Pārlūkot izejas kodu

修复java后端问题

liuchengsen 1 mēnesi atpakaļ
vecāks
revīzija
37a67ca6eb
1 mainītis faili ar 10 papildinājumiem un 0 dzēšanām
  1. 10 0
      data-pipeline/test_parse.py

+ 10 - 0
data-pipeline/test_parse.py

@@ -0,0 +1,10 @@
+"""测试解析:预览前10个 DOCX 文件"""
+from docx_ingest import *
+
+files = find_docx_files('/opt/2025')[:10]
+for f in files:
+    e = parse_docx(f)
+    if e:
+        print(f'{e["name"]} | {e["category"]} | {len(e["sections"])} sections | keys: {list(e["sections"].keys())[:5]}')
+    else:
+        print(f'SKIP: {f}')