티스토리 뷰
목차
정부의 독자 AI 파운데이션 모델, 이른바 독파모 사업에서 SK텔레콤과 업스테이지가 2차 평가를 두 달도 채 안 남겨두고 핵심 개발 목표와 자체 평가 기준을 바꿨습니다. 이 소식을 처음 접했을 때 솔직히 '아, 또 이런 일이'라는 생각이 먼저 들었습니다. AI 기술이 빠르게 변한다는 건 모두가 아는 사실인데, 그게 목표를 바꾸는 이유가 될 수 있는지는 전혀 다른 이야기이기 때문입니다.

무빙타깃, 과녁이 앞으로 움직였는가 뒤로 움직였는가
독파모는 글로벌 프런티어 AI 모델의 95% 수준에 달하는 자체 AI 모델을 개발하겠다는 목표로 출발한 정부 사업입니다. 여기서 파운데이션 모델(Foundation Model)이란, 대규모 데이터를 학습해 번역·요약·코딩·대화 등 다양한 작업에 범용적으로 활용할 수 있는 초거대 AI 기반 모델을 의미합니다. GPT나 Claude 같은 모델이 대표적인 예입니다.
정부는 이 사업에서 '무빙타깃' 전략을 핵심으로 내세웠습니다. 무빙타깃이란 일정 주기마다 비교 대상과 개발 목표를 재설정하는 방식으로, 글로벌 AI 기술이 워낙 빠르게 발전하기 때문에 처음 설정한 목표를 고정하면 결국 시대에 뒤처진 기준을 달성하는 데 그칠 수 있다는 문제의식에서 나왔습니다. 개념 자체는 충분히 납득이 갑니다.
그런데 제가 이번 뉴스를 보면서 불편함을 느낀 지점은 바로 여기서 시작됩니다. SK텔레콤은 2단계 협약 종료일인 6월 30일을 한 달여 앞둔 5월 27일에 개발 목표 변경을 요청했습니다. 기존에는 대규모언어모델(LLM) 1개를 개발하는 것이 목표였는데, 이를 LLM과 별도 모델 3개를 개발하는 방향으로 수정했습니다. 여기서 LLM이란 수천억 개 이상의 매개변수(파라미터)로 학습된 초대형 언어 모델을 뜻하며, ChatGPT나 Gemini처럼 자연어를 이해하고 생성하는 핵심 엔진 역할을 합니다.
SK텔레콤 측은 목표를 낮춘 것이 아니라 에이전틱 AI 대응 강화와 경량 모델 필요성에 따라 모델을 추가한 것이라고 설명했습니다. 여기서 에이전틱 AI(Agentic AI)란 단순히 질문에 답하는 것을 넘어 스스로 계획을 세우고 여러 단계의 작업을 자율적으로 수행하는 AI 시스템을 말합니다. 실제로 AI 업계의 흐름이 그쪽으로 가고 있다는 점은 저도 체감합니다.
하지만 숫자를 보면 조금 다른 생각이 듭니다. 1차 평가 모델 A.X K1에 투입됐던 학습데이터 양이 10T(10조 개 토큰)였는데, 2차 평가 모델 A.X K2에는 약 8T 수준으로 약 20% 줄었습니다. SK텔레콤은 데이터 양보다 품질을 높였다고 밝혔고, 실제로 AI 학습에서 데이터의 질이 양만큼 중요하다는 것은 맞는 말입니다. 하지만 이 판단이 맞는지 틀린지를 외부에서 확인할 수 있는 근거 자료가 충분히 공개됐는가, 그 점이 제 눈에는 아직 불투명하게 보였습니다.
- SK텔레콤: 개발 목표를 LLM 1개에서 LLM + 별도 모델 3개로 변경, 학습데이터 약 20% 감소 (10T→8T)
- 업스테이지: 자체 평가 비중에서 한국어·영어 각 5%씩 줄이고, 에이전트 평가 10% 추가
- 1단계에서도 LG AI연구원, 네이버클라우드, NC AI, 업스테이지 모두 목표 변경 요청 — 심의위원회 전부 승인
- 업스테이지의 벤치마크 명칭 변경 요청만 "단순 오기재로 보기 어렵다"며 유일하게 불승인
평가 기준이 바뀌면 성과를 어떻게 믿을 수 있는가
제가 이 뉴스를 보며 가장 불편하게 느낀 부분은 사실 목표 변경 그 자체가 아니었습니다. 평가 기준까지 함께 바뀌었다는 점이었습니다.
업스테이지는 자체 평가 방식도 수정했습니다. 기존에는 한국어 40%, 영어 40%, 일본어 20%로 구성됐던 평가 비중을 한국어·영어 각 35%로 조정하고 에이전트 평가 항목을 10% 새로 추가했습니다. 업스테이지는 또한 자체 평가 벤치마크의 명칭을 바꾸려 했는데, 심의위원회는 이를 오기 정정으로 볼 수 없다며 유일하게 불승인했습니다. "V1과 V2의 평가 기준 및 방식의 차이가 매우 크다"는 이유였습니다. 여기서 벤치마크(Benchmark)란 AI 모델의 성능을 객관적으로 측정하기 위해 사용하는 표준화된 테스트 데이터셋과 평가 지표를 뜻합니다. 같은 벤치마크로 비교해야 진짜 실력 차이를 알 수 있는 만큼, 중간에 이걸 바꾸는 것은 시험 도중 문제를 교체하는 것과 비슷한 일입니다.
제가 실제로 업무에서 AI 툴을 여러 가지 써보면서 느낀 것 중 하나는, 평가 기준이 달라지면 결과를 비교하는 게 사실상 불가능해진다는 점입니다. 예를 들어 올해 쓴 모델과 작년 모델을 비교할 때 테스트 방식 자체가 다르면 숫자가 높아도 실제로 더 나아진 건지 알 수가 없습니다. 독파모 사업도 마찬가지입니다. 1차 평가와 2차 평가의 기준이 달라졌다면, 그 사이 성과를 어떻게 연속적으로 판단할 것인가 하는 문제가 생깁니다.
국회 과학기술정보방송통신위원회 소속 김장겸 의원은 "과녁을 옮길 자유는 더 높이 쏘라고 준 것이지, 맞히기 쉽게 하라고 준 것이 아니다"라고 지적했습니다(출처: 이투데이). 저는 이 한 문장이 이번 논란의 본질을 가장 명확하게 짚었다고 생각합니다.
정부가 국가 예산을 투입하는 사업에서 수행기관이 목표와 평가 방식을 함께 변경할 수 있다면, 성과를 공정하게 평가하는 것은 점점 어려워집니다. 물론 참여 기업들이 경영·영업상 비밀을 이유로 수행계획 변경서 일부를 블라인드 처리해 외부에서 전체 맥락을 파악하는 데 한계가 있다는 점도 고려해야 합니다. 그렇더라도 세금이 들어가는 사업인 만큼 변경 전후의 목표를 나란히 비교할 수 있는 자료는 공개돼야 한다고 생각합니다.
과학기술정보통신부가 운영하는 이 사업의 구조와 평가 원칙은 정부 공식 채널(출처: 과학기술정보통신부)을 통해 더 구체적으로 공개될 필요가 있습니다. 지금처럼 "전문가 심의위원회를 거쳐 승인했다"는 것만으로는 국민이 납득하기에 충분한 설명이 아닙니다.
자주 묻는 질문
Q. 독파모 사업이 뭔가요? 일반인과 관계있는 건가요?
A. 독파모는 정부가 국내 기업들을 선정해 글로벌 수준의 자체 AI 파운데이션 모델 개발을 지원하는 사업입니다. 당장 체감하기는 어렵지만, 장기적으로는 한국어에 특화된 AI 서비스 품질, 국내 기업의 해외 기술 의존도, 금융·의료·행정 등 다양한 분야의 AI 서비스 수준에 영향을 줍니다. 국민 세금이 투입되는 만큼 성과를 지켜볼 이유가 충분합니다.
Q. 무빙타깃 전략이 나쁜 건가요?
A. 개념 자체는 합리적입니다. AI 기술이 몇 달 사이에도 크게 달라지는 만큼, 처음 설정한 목표를 끝까지 고집하면 오히려 시대에 뒤처진 기준을 달성하는 데 그칠 수 있습니다. 문제는 목표를 바꿀 때 그 방향이 위를 향하는지 아래를 향하는지를 외부에서 확인할 수 없다는 점입니다. 전략 자체보다 운용의 투명성이 핵심입니다.
Q. 학습데이터가 줄면 AI 성능도 떨어지는 건가요?
A. 반드시 그렇지는 않습니다. AI 학습에서는 데이터의 양뿐 아니라 품질, 다양성, 학습 방식, 모델 구조가 모두 성능에 영향을 줍니다. SK텔레콤이 데이터를 20% 줄이면서 품질을 높였다고 밝힌 것처럼, 불필요한 데이터를 걷어내고 정제된 데이터만 쓰면 오히려 성능이 올라가는 경우도 있습니다. 다만 이 주장이 사실인지는 실제 평가 결과가 나와야 확인할 수 있습니다.
Q. 심의위원회가 승인했으면 문제없는 거 아닌가요?
A. 심의위원회의 승인은 절차적 적법성을 뜻하지, 목표 변경의 방향이 옳다는 보증은 아닙니다. 실제로 업스테이지의 벤치마크 명칭 변경 요청은 심의위원회가 단순 오기로 볼 수 없다며 불승인했습니다. 결국 중요한 것은 심의 결과가 있느냐가 아니라, 그 심의 내용과 근거가 국민에게 충분히 공개됐느냐의 문제입니다.
결론
제 경험상 어떤 프로젝트든 중간에 계획을 바꿔야 할 때는 반드시 생깁니다. 그것 자체를 문제라고 보기는 어렵습니다. 하지만 '왜 바꿨는가'와 '어떻게 바뀌었는가'를 설명하지 못하면 신뢰를 잃는 것은 시간문제입니다. 독파모 사업도 마찬가지입니다. 무빙타깃이라는 전략이 세계 최고 수준을 향해 목표를 계속 끌어올리는 방식으로 작동하고 있다면 지금보다 훨씬 자신 있게 공개해도 될 것입니다.
앞으로 주목해야 할 것은 2차 평가에서 실제로 어떤 성능이 나오는가입니다. 모델 숫자가 늘었는지, 데이터가 줄었는지보다 글로벌 AI 모델과 비교했을 때 실질적인 경쟁력이 올라갔는지가 진짜 질문입니다. 평가 결과와 함께 변경 전후의 목표를 투명하게 공개하는 것이 이번 논란을 매듭짓는 가장 빠른 방법이라고 생각합니다.
참고: https://www.etoday.co.kr/news/view/2632295?trc=right_hot_news