exporter¶
Confluence Page Exporter
Export Confluence pages to XML format for AI knowledge base ingestion. The XML output contains structured metadata and markdown content optimized for LLM context injection.
- docpack_confluence.exporter.export_pages_to_xml_files(pages: List[Page], dir_out: Path, breadcrumb_type: BreadCrumbTypeEnum = BreadCrumbTypeEnum.title, wanted_fields: Set[ConfluencePageFieldEnum] | None = None, ignore_to_markdown_error: bool = True, encoding: str = 'utf-8', clean_output_dir: bool = False) None[source]¶
Export Confluence pages to individual XML files.
Each page is serialized to XML with metadata and markdown content, named by its breadcrumb path to preserve hierarchy.
- Parameters:
pages – Pages to export (from crawler)
dir_out – Output directory for XML files
breadcrumb_type – Filename format - use page IDs or titles
wanted_fields – Fields to include in XML; None means all fields
ignore_to_markdown_error – Skip errors during markdown conversion
encoding – Output file encoding
clean_output_dir – Remove output directory before export
- docpack_confluence.exporter.merge_files(dir_in_list: List[Path], path_out: Path, ext: str = '.xml', input_encoding: str = 'utf-8', output_encoding: str = 'utf-8', overwrite: bool = True) None[source]¶
Merge exported files into a single document.
Collects all files with specified extension from input directories and concatenates them into one file for AI context ingestion.
- Parameters:
dir_in_list – Directories containing files to merge
path_out – Output file path
ext – File extension filter (e.g., “.xml”)
input_encoding – Input files encoding
output_encoding – Output file encoding
overwrite – If False, raise error when output exists
- Raises:
FileExistsError – If output exists and overwrite is False