skills: update skills
This commit is contained in:
@@ -1,10 +1,12 @@
|
||||
"""Generate bilingual.dj from DOCX manuscript only (no PDF).
|
||||
Source: Chinese from DOCX. Target: English from DOCX.
|
||||
"""
|
||||
import re, subprocess, os
|
||||
import re, subprocess
|
||||
from pathlib import Path
|
||||
|
||||
DOCX = "/home/user/documents/mpi/translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
|
||||
OUT_DIR = "/home/user/documents/mpi/translate-files/佛教徒的人生态度"
|
||||
ROOT = Path(__file__).resolve().parent.parent
|
||||
DOCX = ROOT / "translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
|
||||
OUT_DIR = ROOT / "translate-files/佛教徒的人生态度"
|
||||
|
||||
def has_cjk(s):
|
||||
return any('\u4e00' <= c <= '\u9fff' for c in s)
|
||||
@@ -124,5 +126,5 @@ if __name__ == '__main__':
|
||||
pairs = extract_pairs(text)
|
||||
print(f" Pairs: {len(pairs)}")
|
||||
|
||||
out = os.path.join(OUT_DIR, 'bilingual.dj')
|
||||
out = OUT_DIR / "bilingual.dj"
|
||||
generate(pairs, out)
|
||||
|
||||
@@ -6,11 +6,13 @@ Target: English from PDF typeset.
|
||||
Strategy: find each DOCX English paragraph in PDF body, extract
|
||||
the PDF text region for that paragraph using position boundaries.
|
||||
"""
|
||||
import re, subprocess, os
|
||||
import re, subprocess
|
||||
from pathlib import Path
|
||||
|
||||
DOCX = "/home/user/documents/mpi/translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
|
||||
PDF = "/home/user/documents/mpi/translate-files/佛教徒的人生态度/0607-二排-果澄-佛教徒的人生态度-一校-多人-0607.pdf"
|
||||
OUT_DIR = "/home/user/documents/mpi/translate-files/佛教徒的人生态度"
|
||||
ROOT = Path(__file__).resolve().parent.parent
|
||||
DOCX = ROOT / "translate-files/佛教徒的人生态度/定稿 佛教徒的人生态度 善鑫慧炬照禅道靖妙一观轩慈德20260527.docx"
|
||||
PDF = ROOT / "translate-files/佛教徒的人生态度/0607-二排-果澄-佛教徒的人生态度-一校-多人-0607.pdf"
|
||||
OUT_DIR = ROOT / "translate-files/佛教徒的人生态度"
|
||||
|
||||
|
||||
def has_cjk(s):
|
||||
@@ -256,5 +258,5 @@ if __name__ == '__main__':
|
||||
print("Extracting segments...")
|
||||
segments = extract_segments(pdf_body, positions)
|
||||
|
||||
out = os.path.join(OUT_DIR, 'bilingual.dj')
|
||||
out = OUT_DIR / "bilingual.dj"
|
||||
generate(pairs, segments, out)
|
||||
|
||||
@@ -1,10 +1,12 @@
|
||||
"""Generate bilingual.dj from DOCX for 「生命也可以被设计的」.
|
||||
One-pass approach: walk interleaved paragraphs, handle multi-CN sequences.
|
||||
"""
|
||||
import re, subprocess, os
|
||||
import re, subprocess
|
||||
from pathlib import Path
|
||||
|
||||
DOCX = "/home/user/documents/mpi/translate-files/生命也可以被设计的/中英文定稿-260324-生命也是可以被设计的-妙一宽山静雅初翻 慈鎏妙一审议 宽山定稿.docx"
|
||||
OUT_DIR = "/home/user/documents/mpi/translate-files/生命也可以被设计的"
|
||||
ROOT = Path(__file__).resolve().parent.parent
|
||||
DOCX = ROOT / "translate-files/生命也可以被设计的/中英文定稿-260324-生命也是可以被设计的-妙一宽山静雅初翻 慈鎏妙一审议 宽山定稿.docx"
|
||||
OUT_DIR = ROOT / "translate-files/生命也可以被设计的"
|
||||
|
||||
def has_cjk(s):
|
||||
return any('\u4e00' <= c <= '\u9fff' for c in s)
|
||||
@@ -177,5 +179,5 @@ if __name__ == '__main__':
|
||||
pairs = extract_body_pairs(text)
|
||||
print(f" Pairs: {len(pairs)}")
|
||||
|
||||
out = os.path.join(OUT_DIR, 'bilingual.dj')
|
||||
out = OUT_DIR / "bilingual.dj"
|
||||
generate(toc_cn, toc_en, pairs, out)
|
||||
|
||||
Reference in New Issue
Block a user