从_能用_到_好用_——混元翻译模型核心能力与架构实践分享_35页_4mb
报告摘要
HY-MT: 腾讯混元轻量级大模型的翻译训练与优化实践总结
核心内容
腾讯混元团队(HY-MT)在翻译模型领域取得了显著进展,尤其是在多语言翻译和轻量级模型部署方面。HY-MT在WMT2025通用翻译赛道中,实现了31个语种中的30个语种第一,其效果超越了包括Gemini-2.5-Pro、Claude-4、DeepSeek-V3等在内的多个主流模型。此外,HY-MT开源了多个模型版本,支持33种语言的互译,并且在端侧部署方面表现出色,仅需1GB内存即可运行,且在翻译质量上优于主流商用API。
主要观点
- 多语言翻译能力:HY-MT支持包括常见语种如英语、中文、德语、日语,以及小语种如捷克语、马拉地语、爱沙尼亚语、冰岛语等。
- 开源与性能:HY-MT1.5-7b、HY-MT1.5-1.8b、HY-MT-Chimera三个模型开源,Huggingface首页趋势榜排名第一,开源28天下载量超30万次。
- 应用场景广泛:HY-MT已应用于腾讯会议、腾讯游戏出海、企业微信、微信读书、QQ浏览器、腾讯海外客服、腾讯云翻译等多个业务场景,包括实时翻译、划词翻译、文档翻译、字幕翻译等。
- 翻译质量:在多个测试集上,HY-MT1.5-1.8B表现出色,尤其在俚语、术语和长难句翻译上,其效果优于许多其他模型。
关键信息
近期进展
- 在WMT2025通用翻译赛道中,HY-MT在31个语种中获得30个语种第一。
- 支持33种语言互译,包括5种民汉语言/方言互译、俚语翻译等特色功能。
开源模型
- 开源HY-MT1.5-7b、HY-MT1.5-1.8b、HY-MT-Chimera。
- Huggingface趋势榜排名第一,28天下载量超30万次。
多场景应用落地
- 接入腾讯会议、腾讯游戏出海、企业微信、微信读书、QQ浏览器、腾讯海外客服、腾讯云翻译等。
- 支持实时翻译、会后翻译、网页翻译、视频/直播翻译、字幕翻译等。
翻译效果
- 在Flores200和WMT25测试集上,HY-MT1.5-1.8B翻译质量全面超越中等尺寸开源模型和主流商用API。
- 在术语翻译方面,采用TAT-R1训练方法,通过强化学习和多种评估指标提升翻译质量。
训练方案详解
多语言培训(CPT)
- 采集/合成大量多语种数据,涵盖33种语言。
- 对中英数据进行replay,防止多语言增训影响中英能力。
- 通过实验确定最优语种配比。
高质量平行语料获取(SFT)
- 对高资源语种采用少量网络收集和内部人工标注数据训练融合模型。
- 使用该模型融合多个大模型的翻译结果,提高质量。
- 对低资源语种采用高资源语种桥接,结合多维度质量打分筛选。
多语言RM设计(RL)
- 通用翻译质量与领域翻译质量并重。
- 引入术语词对齐、术语出现顺序、思维链是否包含关键术语等维度。
- 使用基于规则和基于模型的评估方法,提升翻译效果。
术语翻译提升
- 通过TAT-R1训练方法,结合术语库和例句库,提升术语翻译效果。
- 建设可编辑、实时生效的术语库模块,提升模型的指令遵循能力。
应用场景能力建设
带格式翻译
- 支持企微邮件翻译、QQ浏览器网页翻译、腾讯视频字幕翻译等。
- 设计协议承载原始格式信息,确保翻译语义连贯。
实时翻译
- 支持腾讯会议会中翻译、腾讯财报会同声传译、QQ浏览器视频/直播翻译等。
- 采用模型小型化、补充口语化数据、增强多轮对话一致性等方式优化实时翻译效果。
术语、例句库翻译
- 提供术语和例句库检索模块,支持定制化翻译需求。
- 提升模型在专业领域内的翻译专业度。
词典翻译与解释性翻译
- 词典知识注入:收集牛津词典、21世纪大英汉词典等词典数据。
- 例句解释知识注入:收集解释性翻译数据,提升翻译的可解释性和准确性。
经验总结
- 高质量数据获取和构造:是模型训练和优化的关键,尤其在离线数据处理上需要大量精力和时间。
- Reward Model定义:需要明确翻译质量与格式保留的平衡,挑战较大。
- 强化学习训练:需要稳定、长时间的训练,优化算法是提升模型效果的关键。
- 部署与推理优化:在本地部署上,采用VLLM高性能引擎、LM Studio图形化部署等方式,提升推理效率和用户体验。
未来展望
- DENSE模型架构升级:提升模型的词汇量和上下文支持能力。
- 语音与图像翻译:拓展到语音端到端翻译、图片/视频翻译等。
- 助评AGENT:利用memory解决长文翻译一致性问题。
- 部署方案优化:包括HuggingFace Transformers、VLLM高性能引擎、LM Studio图形化部署等,各有优劣,适用于不同场景。
部署方案概览
主流部署方案对比
| 对比维度 | HuggingFace Transformers | VLLM | LM Studio |
|---|---|---|---|
| 技术架构 | PyTorch/TensorFlow封装Pipeline统一接口 | PagedAttention引擎C++/CUDA优化 | llama.cpp引擎GGUF格式支持 |
| 性能表现 | ★★☆☆☆ | ★★★★★ | ★★★☆☆ |
| 显存利用率 | 原生推理效率较低 | 吞吐量提升24倍 | CPU/GPU混合推理 |
| 显存效率 | ~40% | >95% | ★★★☆☆ |
| 易用性 | ★★★☆☆ | ★★★☆☆ | ★★★★★ |
| 适用场景 | 快速原型验证、小规模推理 | 生产环境 | 个人桌面体验、教育演示 |
| 核心优势 | 生态丰富、灵活性高 | 极致性能 | 零代码、图形界面 |
核心特性
- HuggingFace Transformers:提供统一接口,支持多种任务,如文本生成、分类、问答、翻译等。
- VLLM:基于PagedAttention技术,显著提升显存利用率和吞吐量,支持高并发和长上下文翻译。
- LM Studio:提供图形化界面,适合非技术用户,支持多种模型格式,如GGUF,降低硬件要求。
总结
HY-MT在多语言翻译和轻量级模型部署方面展现出卓越的能力,不仅在学术竞赛中取得优异成绩,还在实际应用场景中广泛应用。通过高质量数据构造、多维度评估模型、强化学习优化等手段,HY-MT实现了翻译效果与效率的双重提升。未来,HY-MT将继续优化模型架构,拓展翻译应用场景,并通过多种部署方案满足不同用户需求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载