调用腾讯混元翻译接口时,模型可能根据自身理解对专业术语进行翻译,例如“大模型”可能被译成“Big Model”而非预期的“Large Model”。要强制模型按照指定译法执行,关键步骤是创建并加载术语库。下面直接提供实操指南,逐步讲解。

准备术语CSV文件
新建一个纯文本文件,命名为terms.csv。格式简洁:使用英文逗号分隔源语言词与目标语言词,首行写入表头term_cn,term_en。每行一条术语,避免空行,不加引号,也不使用中文标点。示例如下:
人工智能,Artificial Intelligence
大模型,Large Model
推理延迟,Inference Latency
上下文感知,Context-Aware
【文件编码必须为UTF-8无BOM】。用记事本另存为时,请选择“UTF-8”而非“UTF-8-BOM”,否则模型读取时会出错。
启动服务时挂载术语表
若使用预置镜像“Tencent-Hunyuan/HY-MT1.5-1.8B”,启动容器时需将本地的terms.csv映射到容器内的固定路径。命令如下:
docker run -d -p 7860:7860 -v $(pwd)/terms.csv:/app/terms.csv tencent-hunyuan/hy-mt1.5-1.8b
注意:容器内术语表路径必须为/app/terms.csv,这是该镜像硬编码的加载位置,更改为其他路径将无效。
调用API时启用术语干预
向模型发送请求时,需在messages.content中加入明确的指令,格式必须严格匹配:
“参考以下术语翻译:
“人工智能”→“Artificial Intelligence”
“大模型”→“Large Model”
将以下文本翻译为英文,只输出译文,不加解释:……”
术语必须使用中文引号“”,箭头用“→”,每条术语独占一行,并与后续翻译指令之间空一行。若使用Python调用,可动态拼接:
terms_block = "\n".join([f'"{cn}"→"{en}"' for cn, en in term_pairs])
prompt = f"参考以下术语翻译:\n{terms_block}\n将以下文本翻译为{target_lang},只输出译文,不加解释:{text}"
如此便能确保模型严格遵循您指定的术语表进行翻译,避免自由发挥。
