游戏本地化中的人工智能现状如何?
游戏开发的发展仍然日新月异。越来越多的工作室将更新频次提升到以周为基准,以满足全球玩家的期望,而无论是AAA级还是独立游戏,都面临着在多个市场同时发布的压力。
在这种环境中,本地化团队正在转向诸如LLMs、Agentic工作流和AIQE工具等人工智能(AI)解决方案,以在维持品质的同时扩大其产出和效率。
在下文中,我们将探讨当前AI本地化技术的实际发展状况,涵盖目前有效的方面和不足之处,以及我们认为游戏团队在本地化过程中寻求平衡速度、质量和成本时最有潜力的领域。

游戏本地化中的Agentic工作流
在我们的团队以及整体行业中,AI的测试和应用几乎体现在游戏开发的方方面面。在这些整合运用之中,Agentic工作流代表了最重要的发展之一。
在游戏本地化的语境下,Agentic工作流指的是使用多个自主AI智能体来监督、管理和执行一系列任务。目前,这些系统被用于诸如内容分类、术语问答、元数据标记,和最理所当然的翻译等任务。对于较简单的任务,它们已被证明效果可观。
然而,当工作流程变得更加复杂和富有创意时,这一方法的可靠性、质量和效率往往就会相应下降。原因有以下几点:
- 链条脆弱性:智能体参与的流程越多,错误的风险就越高。如果队列中的一个智能体出现任何错误,整个链条都会受到影响。
- 训练复杂性:许多专业人士都苦于应对基本的AI提示指令。他们不熟悉如何编写有效的提示、管理上下文窗口或对输出进行迭代。Agentic工作流需要协调多个专门的智能体,每个智能体都需要不同的指令、参数和质量阈值。如果不打造扎实的基础,团队配置的工作流程就不够完善,并有可能导致各种无法预测的失败。
- 组织扩展:大规模的流程整合(尤其是涉及不同部门时)会加剧这种复杂性。如果您的部门之间此前没有建立协调的工作流程,那么设置Agentic工作流可能会更加困难。
Agentic工作流:链条脆弱性示例

为应对这些挑战,需要预先设定现实期望,并在实施时小心谨慎。关键在于理解每个工作流程的局限性,并为您的特定游戏内容选择合适的技术。
从机器翻译到人工智能在游戏本地化中的应用
如今,基于AI的本地化工作流程中主要使用两种翻译技术:大型语言模型(LLMs)和神经机器翻译(NMTs)。每种选择都有其独特的优势和挑战。那么,如何为你的游戏选择合适的方案呢?
神经机器翻译(NMTs)
诸如DeepL和Google Translate的神经机器翻译引擎具有一些关键优势,因此是某些内容类型的首选。它们的规律性很强,且高度一致——多次翻译相同的文本将获得相同的结果。他们的稳定和可靠性使其非常适合翻译菜单、静态UI元素、支持文档以及其他“一致性>创造性”的内容。
这些系统还可以针对特定的工作流程和语言对进行高度定制,并通过翻译记忆库集成功能使其提升对游戏续作和持续更新内容的支持能力。NMTs引擎的速度、低成本和数据安全性的结合使其成为现代本地化工作流程中的重要组成部分。
然而,当处理创意内容时,这些优势可能反而会成为一种限制。NMT引擎的翻译通常会给人过于直白或“机翻味浓重”的感觉,因为和LLM引擎不一样,这些系统无法通过给予提示的方式优化算法。它们基于特定数据集的训练和统计模式,而非上下文生成翻译内容。
虽然NMT引擎目前仍在本地化工作流程中发挥核心作用,但随着内容需求变得更加具有创意和复杂性,许多开发者开始倾向于使用大型语言模型(LLM)来处理对话和叙事元素。
大型语言模型(LLMs)
大型语言模型如GPT-4、Gemini和Claude,在处理创意对话、叙述内容和具有文化细微差别的翻译方面表现出色。因为它们可以遵循详细的指示定制输出内容,并能够调整语气和风格,以匹配特定的角色设定或IP风格指南。
然而,这一方案同样面临许多挑战。最主要的障碍仍然是一致性。即使精心准备了提示和词汇表,LLMs在一些情况下对同一术语也可能产生不同的翻译结果。此外,尽管LLMs在处理创意文本方面优于传统机器翻译,但距离真正自然的表述仍然存在距离。在许多情况下,翻译确实足够正确,也遵循了指示,但“机翻感”仍然很容易被察觉。
适用于NMT和LLM的内容适配表格,含人工后期编辑
| 内容类型 | 可用技术整合方案 | 说明 |
| UI 文本 / 系统消息 | ✅ NMT | 基于上下文的简短功能性文本 |
| 游戏内说明 | ✅ NMT | 结构化、高度重复、说明类 |
| 任务 / 任务描述 | ⚖️ NMT + LLM | 有一定风格倾向的文本,需要轻微调整 |
| 道具 / 技能名称 | ⚖️ NMT + LLM | 需要进行一致性审查 |
| 对话 / 叙事内容 | ⭐ LLM | 需要角色参考和背景故事来训练LLM,确保情感深度和细腻程度。 |
| 配音脚本 | 👤 仅人工 | 表达必须自然地道,且符合文本长度限制 |
| 营销 / 宣传内容 | 👤 仅人工 | 需要创造力与创意改编 |
在两种方法都均存在明显局限性的情况下,自动化AIQE对于扩展AI翻译就变得至关重要,这就是我们接下来要介绍的质量评估 (QE)。
质量评估 (QE)
质量评估(QE)是一种AI系统,可在没有人工审阅者或参考翻译的情况下自动评估翻译质量。它分配置信度分数并标记潜在问题,筛选高质量的翻译并将其发布,而将存在问题的翻译交由人工审核,
该技术已在某些行业中投入使用:例如,电子商务已成功基于已建立的模型和可预测的内容模式将QE整合进入工作流程。QE已引起行业的广泛关注,在诸如LocWorld等会议上,不同的模型已开始被排名和比较。
QE工作流程示例

然而,游戏本地化呈现出了当前QE系统难以应对的独特复杂性。内容的多样性与不同的作业风格意味着每个游戏都需要对QE进行定制和校对,而不是使用标准化的模型。这导致结果中出现过多误报内容,例如QE标记了并非实际存在的问题,或是忽视了人工校对能够立即发现的上下文不一致问题。
数据缺失是其中最根本的挑战。QE系统依赖于在通用数据集上训练的大型语言模型,而非不同游戏的特定内容。虽然定制训练的模型可能表现更好,但这又会引发关于哪些数据可以合法用于训练的法律和商业问题。
目前,游戏本地化中的QE仍然停留在承认潜力的阶段,但还未真正实现运用。游戏内容的复杂性和创造性的需求意味着,人类的专业知识在质量保证方面始终是不可替代的。而这就是为什么……
人工干预仍然至关重要
虽然AI系统展示了令人期待的潜力,但在当前的游戏本地化流程中,人类的专业知识与监督仍然十分重要。无论是训练和改进人工智能系统、在团队之间进行沟通还是提供本地化质量保证 (LQA),这些人员都是必需的。
人类所能提供的视角是AI无法复制的。他们能够理解上下文的内容,发现自动化系统遗漏的问题,并能够判断翻译的流畅和自然程度是否能真正为各个目标市场的玩家所接受。
统一的方法:RESOLVE
结合AI的效率和人类专业知识的本地化工作流程才是最为切实有效的。我们的RESOLVE解决方案专为本地化的玩家支持打造,这是一个将Agentic工作流、LLM、NMT、QE和人工监督整合为一个统一系统的实例。
RESOLVE会动态选择最佳翻译引擎(Google Translate、DeepL、ChatGPT等),以适应需求的语言对。系统通过BLEU评分和专有算法持续监控翻译质量,并自动将不合格的翻译交由人工后期编辑。如果自动化翻译的质量未达到阈值,人工专家会修正翻译并提供反馈,以改进未来的输出结果。
最重要的是,RESOLVE解决了促使Agentic工作流不稳定的组织复杂性。要求团队在多个定制智能体之间流转协调是不切实际的——而RESOLVE会自动管理工具选择、QE和问题升级流程,在不增加足以影响运营的成本的情况下大幅提升AI的效率。

寻找前进的道路
AI在游戏本地化中的潜力是真实的,但其当前的局限性也亦如是。Agentic工作流在任务变得更复杂时会崩溃;LLMs更具有创造性,但存在不一致性问题;NMTs仅在极少数领域中表现出色;而QE系统在当前还无法为游戏内容服务。然而,尽管存在这些限制,每个系统都仍然具有各自的价值。与其等待这些技术缓慢各自发展成熟,不妨抓住当前的机会,考虑充分后整合利用各自的优势。
各大工作室和团队正是采用这种方法在AI本地化方面取得了成功——他们并未单独引入每一项新工具,而是战略性地理解了如何将人工智能的效率与人类的专业知识相结合。
想知道适合您的游戏的最佳本地化方案吗?
我们是AI本地化技术与定制化工作流程的专家,为我们广泛的客户群体(从独立开发者到3A级开发厂商)提供高效的整合工具。如果您对工具、时间表或技术可行性存在疑问,请与我们的团队取得联系!