exporter

Confluence Page Exporter

Export Confluence pages to XML format for AI knowledge base ingestion. The XML output contains structured metadata and markdown content optimized for LLM context injection.

docpack_confluence.exporter.export_pages_to_xml_files(pages: List[Page], dir_out: Path, breadcrumb_type: BreadCrumbTypeEnum = BreadCrumbTypeEnum.title, wanted_fields: Set[ConfluencePageFieldEnum] | None = None, ignore_to_markdown_error: bool = True, encoding: str = 'utf-8', clean_output_dir: bool = False) None[source]

Export Confluence pages to individual XML files.

Each page is serialized to XML with metadata and markdown content, named by its breadcrumb path to preserve hierarchy.

Parameters:
  • pages – Pages to export (from crawler)

  • dir_out – Output directory for XML files

  • breadcrumb_type – Filename format - use page IDs or titles

  • wanted_fields – Fields to include in XML; None means all fields

  • ignore_to_markdown_error – Skip errors during markdown conversion

  • encoding – Output file encoding

  • clean_output_dir – Remove output directory before export

docpack_confluence.exporter.merge_files(dir_in_list: List[Path], path_out: Path, ext: str = '.xml', input_encoding: str = 'utf-8', output_encoding: str = 'utf-8', overwrite: bool = True) None[source]

Merge exported files into a single document.

Collects all files with specified extension from input directories and concatenates them into one file for AI context ingestion.

Parameters:
  • dir_in_list – Directories containing files to merge

  • path_out – Output file path

  • ext – File extension filter (e.g., “.xml”)

  • input_encoding – Input files encoding

  • output_encoding – Output file encoding

  • overwrite – If False, raise error when output exists

Raises:

FileExistsError – If output exists and overwrite is False