skills: update skills

This commit is contained in:
iacore
2026-06-18 08:24:11 +08:00
parent 8f086cd3da
commit 12134faea9
16 changed files with 242 additions and 28 deletions
@@ -1,10 +1,12 @@
"""Generate bilingual.dj from DOCX manuscript only (no PDF).
Source: Chinese from DOCX. Target: English from DOCX.
"""
import re, subprocess, os
import re, subprocess
from pathlib import Path
DOCX = "/home/user/documents/mpi/translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
OUT_DIR = "/home/user/documents/mpi/translate-files/佛教徒的人生态度"
ROOT = Path(__file__).resolve().parent.parent
DOCX = ROOT / "translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
OUT_DIR = ROOT / "translate-files/佛教徒的人生态度"
def has_cjk(s):
return any('\u4e00' <= c <= '\u9fff' for c in s)
@@ -124,5 +126,5 @@ if __name__ == '__main__':
pairs = extract_pairs(text)
print(f" Pairs: {len(pairs)}")
out = os.path.join(OUT_DIR, 'bilingual.dj')
out = OUT_DIR / "bilingual.dj"
generate(pairs, out)
+7 -5
View File
@@ -6,11 +6,13 @@ Target: English from PDF typeset.
Strategy: find each DOCX English paragraph in PDF body, extract
the PDF text region for that paragraph using position boundaries.
"""
import re, subprocess, os
import re, subprocess
from pathlib import Path
DOCX = "/home/user/documents/mpi/translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
PDF = "/home/user/documents/mpi/translate-files/佛教徒的人生态度/0607-二排-果澄-佛教徒的人生态度-一校-多人-0607.pdf"
OUT_DIR = "/home/user/documents/mpi/translate-files/佛教徒的人生态度"
ROOT = Path(__file__).resolve().parent.parent
DOCX = ROOT / "translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
PDF = ROOT / "translate-files/佛教徒的人生态度/0607-二排-果澄-佛教徒的人生态度-一校-多人-0607.pdf"
OUT_DIR = ROOT / "translate-files/佛教徒的人生态度"
def has_cjk(s):
@@ -256,5 +258,5 @@ if __name__ == '__main__':
print("Extracting segments...")
segments = extract_segments(pdf_body, positions)
out = os.path.join(OUT_DIR, 'bilingual.dj')
out = OUT_DIR / "bilingual.dj"
generate(pairs, segments, out)
+6 -4
View File
@@ -1,10 +1,12 @@
"""Generate bilingual.dj from DOCX for 「生命也可以被设计的」.
One-pass approach: walk interleaved paragraphs, handle multi-CN sequences.
"""
import re, subprocess, os
import re, subprocess
from pathlib import Path
DOCX = "/home/user/documents/mpi/translate-files/生命也可以被设计的/中英文定稿-260324-生命也是可以被设计的-妙一宽山静雅初翻 慈鎏妙一审议 宽山定稿.docx"
OUT_DIR = "/home/user/documents/mpi/translate-files/生命也可以被设计的"
ROOT = Path(__file__).resolve().parent.parent
DOCX = ROOT / "translate-files/生命也可以被设计的/中英文定稿-260324-生命也是可以被设计的-妙一宽山静雅初翻 慈鎏妙一审议 宽山定稿.docx"
OUT_DIR = ROOT / "translate-files/生命也可以被设计的"
def has_cjk(s):
return any('\u4e00' <= c <= '\u9fff' for c in s)
@@ -177,5 +179,5 @@ if __name__ == '__main__':
pairs = extract_body_pairs(text)
print(f" Pairs: {len(pairs)}")
out = os.path.join(OUT_DIR, 'bilingual.dj')
out = OUT_DIR / "bilingual.dj"
generate(toc_cn, toc_en, pairs, out)