게임 현지화에서 AI의 현주소는?
게임 개발은 그 어느 때보다도 빠르게 발전하고 있습니다. 게임 스튜디오는 전 세계 플레이어들의 기대치를 충족시키기 위해 매주 업데이트를 진행하고 있으며, AAA급 게임과 인디 게임 모두 다양한 플랫폼에서 동시에 출시해야 한다는 압박을 받고 있습니다.
이러한 환경에서 현지화 팀들은 품질 기준을 유지하면서 생산성과 효율성을 높이기 위해 LLM, 주도적 워크플로, 품질 평가 도구와 같은 AI 솔루션을 활용하고 있습니다.
아래에서는 AI 현지화 기술이 현재 어느 수준에 와 있는지 살펴보고, 현재 AI를 잘 활용하는 분야와 그렇지 못한 분야, 그리고 게임 팀이 현지화 과정에서 속도, 품질, 비용의 균형을 맞추고자 할 때 가장 유망한 분야가 어디인지 다뤄 보겠습니다.

게임 현지화에서의 주도적 워크플로
자사 뿐만 아니라 게임 현지화 업계 전반에서, 인공 지능(AI)은 게임 개발의 사실상 모든 측면에서 테스트 되고 적용되고 있습니다. 이러한 구현 중에서 주도적 워크플로는 가장 중요한 발전 중 하나입니다.
게임 현지화의 맥락에서 주도적 워크플로는 일련의 작업을 감독, 관리 및 실행하는 여러 자율적 AI 에이전트의 사용을 의미합니다. 현재 이러한 시스템은 콘텐츠 분류, 용어집 QA, 메타데이터 태깅은 물론 번역 같은 작업에도 사용됩니다. 간단한 작업에서는 매우 잘 적용된다는 사실이 입증되었습니다.
그러나 워크플로가 복잡해지고 창의적으로 될수록 신뢰성, 품질, 효율성이 떨어지는 경향이 나타났습니다. 이유는 다음과 같습니다.
- 체인 취약성. 워크플로에 에이전트가 많이 투입될수록 실수가 일어날 위험성이 높아집니다. 라인업의 한 에이전트가 실수하거나 해석을 잘못하면, 전체 체인이 무너지게 됩니다.
- 교육 복잡성. 많은 전문가들이 기본적인 AI 프롬프트 작성에 어려움을 겪고 있습니다. 효과적인 프롬프트를 작성하는 방법, 컨텍스트 윈도우를 관리하는 방법, 또는 출력을 반복하는 방법에 익숙하지 않기 때문입니다. 주도적 워크플로는 각각 다른 지침, 매개 변수 및 품질 임계값이 필요한 여러 전문 에이전트들을 조율해야 합니다. 확실한 기초 체계가 없다면, 팀은 터무니없는 형태로 실패하는 잘못 구성된 워크플로로 끝나게 됩니다.
- 조직 규모 확장. 구현 규모가 커지거나 여러 부서가 관련된 경우 복잡성이 더욱 심화됩니다. 부서 간 협력 체계가 구축되어 있지 않다면, 주도적 워크플로를 설정하기 한층 더 어려워집니다.
주도적 워크플로: 체인 취약성 예시

이러한 어려움을 해결하기 위해서는 현실적인 기대와 신중한 실행이 필요합니다. 핵심은 각 워크플로의 한계를 이해하고 특정 게임 콘텐츠에 맞는 적절한 기술을 선택하는 것입니다.
게임 현지화, 기계 번역(MT)에서 인공 지능(AI)으로
오늘날 AI 기반 현지화 워크플로에서는 다음과 같은 두 가지 주요 번역 기술이 사용되고 있습니다. 바로 대규모 언어 모델(LLM)과 신경망 기계 번역(NMT)입니다. 각각의 기술은 고유한 장점과 과제를 제공합니다. 그렇다면, 게임 콘텐츠에는 어느 쪽을 사용해야 할까요?
NMT
신경망 기계 번역 엔진인 DeepL과 Google Translate는 특정 콘텐츠 유형에 선호되는 주요 장점이 있습니다. 안정성이 매우 뛰어나고 일관성이 높기 때문에, 같은 문장을 여러 번 입력해도 동일한 결과를 얻을 수 있다는 점입니다. 이러한 신뢰성 덕분에 메뉴, 고정 UI 요소, 지원 문서 등 창의성보다는 일관성이 중요시되는 분야에 매우 적합합니다.
또한 게임의 후속작이나 지속적인 콘텐츠 업데이트에 매우 유용한 번역 메모리(TM) 통합을 활용하면 특정 워크플로 및 언어 쌍에 맞춰 커스터마이징할 수 있습니다. 시간, 비용 절약 및 데이터 보안 향상이라는 장점 덕분에, 최신 현지화 워크플로에서 NMT는 핵심적인 요소로 자리매김했습니다.
그러나 창의적인 콘텐츠를 다룰 때는 이러한 장점이 한계점으로 다가옵니다. NMT 엔진의 번역은 LLM처럼 사용자가 방향성을 지시하거나 프롬프트를 작성할 수 없기 때문에 원문에서 크게 벗어나지 않는, 딱딱한 직역이 되는 경향이 있습니다. NMT는 특정 데이터 세트에 따른 훈련을 받고, 문맥이 아닌 통계적 패턴을 따라 번역을 제공합니다.
NMT는 현지화 워크플로에서 중추적 역할을 담당하고 있지만, 콘텐츠가 복잡해지고 창의성을 요구받게 되면서 많은 개발자들은 대화문이나 서사 콘텐츠에서는 대규모 언어 모델을 사용하는 경향을 보이고 있습니다.
LLM
GPT-4, Gemini, Claude와 같은 대규모 언어 모델은 창의적인 대화, 서사 콘텐츠, 문화적 뉘앙스가 있는 번역을 처리하는 데 뛰어납니다. 상세한 지침을 따라 출력을 조정할 수 있기 때문에, 특정 캐릭터의 말투나 브랜드 가이드라인에 맞게 어조와 스타일을 조정할 수 있습니다.
하지만, LLM에도 어려움은 있습니다. 가장 큰 장애물은 일관성입니다. 자세하게 준비한 프롬프트와 용어집이 있더라도, LLM은 페이지마다 동일한 용어를 다르게 번역하곤 합니다. 게다가 LLM이 기존의 기계 번역보다 창의적인 텍스트를 더 잘 처리하기는 하지만, 정말로 자연스러운 결과물에는 미치지 못합니다. 대부분의 경우, 정확하고 지시 사항을 잘 따르는 번역물이 제공되지만 여전히 기계적인 느낌을 줍니다.
인간 작업자 사후 수정을 포함한 NMT 및 LLM용 콘텐츠 적합성 매트릭스
| 콘텐츠 유형 | 적합한 기술 통합 | 참고 |
| UI 텍스트/시스템 메시지 | ✅ NMT | 짧고, 기능적이며 컨텍스트 기반 텍스트 |
| 인게임 지시문 | ✅ NMT | 구조화되어 있고, 반복적인 지시문 형식 |
| 퀘스트/임무 설명 | ⚖️ NMT + LLM | 패턴화되어 있는 내용이지만 약간의 조정이 필요 |
| 아이템/스킬 이름 | ⚖️ NMT + LLM | 일관성 확인이 필요함 |
| 대화문/서사 콘텐츠 | ⭐ LLM | 감정적인 깊이나 뉘앙스를 살릴 수 있도록 캐릭터 특성 및 지식에 따라 LLM 훈련 |
| 더빙용 대본 | 👤 인간 작업자 전용 | 시간 제한에 맞춰 최대한 자연스러운 소리를 전달 |
| 마케팅/홍보 콘텐츠 | 👤 인간 작업자 전용 | 창의적인 각색이 필수 |
NMT, LLM 모두 명확한 한계점이 존재하기 때문에, AI 번역을 확대 적용하려면 자동화된 품질 평가가 매우 중요합니다.
품질 평가(QE)
품질 평가(QE)란 인간 작업자의 검수 또는 참고 번역 없이 번역의 품질을 자동으로 평가하는 AI 시스템입니다. 이 시스템은 신뢰 점수를 매기고, 잠재적인 이슈를 발견하여 품질이 뛰어난 번역은 그대로 공개하고 문제가 되는 부분은 인간 작업자에게 돌려보냅니다.
벌써 일부 업계에서는 이 기술을 이미 적용하고 있습니다. 예를 들어 이커머스에서는 확립된 모델과 예측 가능한 콘텐츠 패턴을 기반으로 QE를 성공적으로 활용하고 있는 중입니다. LocWorld와 같은 컨퍼런스에서 다양한 QE 모델을 대상으로 등급을 매기고 비교하는 등, 업계에서도 상당히 주목하고 있습니다.
품질 평가 워크플로 예시

하지만 게임 현지화는 현재의 QE 시스템으로 처리하기 어려운 독특한 복잡성을 가지고 있습니다. 게임 현지화에서는 다양한 콘텐츠와 작업 스타일이 결합되기 때문에, 게임마다 표준화된 모델을 사용하는 대신 맞춤형 QE 보정이 필요합니다. 그렇지 않으면 QE 시스템이 존재하지 않는 문제를 표시하거나, 인간 작업자 검수 단계에서 즉시 발견할 수 있는 맥락상의 문제를 놓치는 등 너무 많은 거짓 양성 결과가 발생하게 됩니다.
근본적인 과제는 데이터입니다. QE 시스템은 게임 특화 콘텐츠가 아닌 일반화된 데이터 세트로 학습된 LLM에 의존합니다. 맞춤형으로 학습된 모델이 더 나은 성능을 보일 수 있지만, 학습에 어떤 데이터를 합법적으로 사용할 수 있는지에 대한 법적, 상업적 우려가 있습니다.
현재, 게임 현지화에서의 QE는 현실보다는 가능성에 더 가깝습니다. 게임 콘텐츠의 복잡성과 창의적인 요구 사항으로 인해 품질을 보증하려면 인간의 전문 지식이 필수적입니다.
인간 작업자는 여전히 필수 요소
AI 시스템이 뛰어난 잠재력을 보여주고 있지만, 인간 작업자의 전문 지식과 검수는 여전히 게임 현지화 워크플로에서 핵심입니다. AI 시스템의 훈련 및 개선뿐만 아니라, 팀간의 소통, 현지화 품질 보증(LQA)을 위해서는 인간 작업자가 필요합니다.
인간 작업자는 AI가 따라 할 수 없는 문화적 관점을 제공합니다. 인간 작업자는 맥락을 통해 콘텐츠를 파악하고, 자동화된 시스템에서 잡아내지 못하는 실수를 잡아내며 게임이 목표 시장의 플레이어에게 정말로 자연스럽게 느껴질지 판단할 수 있습니다.
통합적인 접근: RESOLVE
가장 효율적인 현지화 워크플로는 AI의 효율성과 인간의 전문 지식의 융합입니다. 현지화된 플레이어 지원을 위한 자사의 RESOLVE 솔루션은 주도적 워크플로, LLM, NMT, 품질 평가, 그리고 인간 검수를 시스템 하나로 통합한 사례입니다.
RESOLVE는 언어 쌍에 따른 최적의 번역 엔진(Google Translate, DeepL, ChatGPT 등)을 동적으로 선택합니다. 시스템은 BLEU 점수와 독자적 알고리즘을 통해 번역 품질을 지속적으로 모니터링하며, 기준 이하의 결과물을 자동으로 인간 작업자가 사후 수정할 수 있도록 전달합니다. 자동화된 번역 품질이 기준치를 충족하지 않는 경우, 인간 작업자들이 번역을 수정하고 향후 결과물을 개선하기 위한 피드백을 제공합니다.
무엇보다, RESOLVE는 주도적 워크플로를 취약하게 만드는 조직 복잡성을 해결해 줍니다. 여러 전문 에이전트를 조율하도록 팀에게 요구하는 대신 시스템이 도구 선택, 품질 평가, 인간 작업자 에스컬레이션을 자동으로 관리하여 구현을 일반적으로 방해하는 오버헤드 없이 AI의 효율성 향상을 제공합니다.
여기에서 RESOLVE 솔루션의 기술에 대해 자세히 알아보세요.

앞으로 나아갈 길
게임 현지화에서 AI의 가능성은 실재하지만, 현재 단계에서는 한계 또한 존재합니다. 주도적 워크플로는 작업이 복잡해질수록 제 기능을 발휘하지 못하고, LLM은 창의적이지만 일관성이 없으며, NMT는 좁은 영역 내에서만 우수함을 발휘합니다. 품질 평가 시스템은 아직 게임 콘텐츠에 적용될 준비가 되지 않았습니다. 하지만 이러한 한계에도 불구하고, 각각의 시스템은 여전히 제공할 가치가 있습니다. 이러한 기술들이 개별적으로 성숙해지기를 기다리기보다는, 신중한 통합에서 기회를 찾을 수 있습니다.
AI 현지화에 성공한 스튜디오와 팀들은 바로 이러한 접근 방식을 채택했습니다. 새로운 도구를 전부 구현하는 것이 아니라, AI의 효율성과 인간의 전문 지식을 전략적으로 결합하는 방법을 이해한 것입니다.
귀하의 게임을 현지화하는 가장 좋은 방법이 무엇인지 궁금하신가요?
우리는 인디 게임부터 AAA 게임까지 다양한 고객을 위한 AI 현지화 기술을 전문으로 하며, 맞춤형 워크플로를 구축하고 효과적으로 도구를 통합합니다. 도구, 일정 또는 기술적 실현 가능성에 대해 궁금한 점이 있으시다면, 저희 팀에 연락해 주세요!