test_parse.py 324 B

12345678910
  1. """测试解析:预览前10个 DOCX 文件"""
  2. from docx_ingest import *
  3. files = find_docx_files('/opt/2025')[:10]
  4. for f in files:
  5. e = parse_docx(f)
  6. if e:
  7. print(f'{e["name"]} | {e["category"]} | {len(e["sections"])} sections | keys: {list(e["sections"].keys())[:5]}')
  8. else:
  9. print(f'SKIP: {f}')