독파모 2차 단계평가 결과, 세 팀이 남았습니다 | DAKER 커뮤니티
8월 18일 발표를 두고 가장 많이 섞인 말은 두 가지였습니다. 하나는 최종 2팀이 이미 정해졌다는 해석이고, 다른 하나는 특정 벤치마크 지표가 곧 종합 순위라는 식의 단정입니다. 하지만 이날 나온 공식 내용은 그보다 훨씬 분명하고, 동시에 더 조심해서 읽어야 합니다.
2026년 8월 18일, 과학기술정보통신부는 독자 AI 파운데이션 모델 프로젝트 2차 단계평가 결과를 발표했습니다. 다음 단계에 남은 팀은 업스테이지, SK텔레콤, LG AI연구원입니다. 모티프테크놀로지스는 이번 단계에서 빠졌고, 이후 3차에서 최종 2팀을 고르는 일정이 남아 있습니다.

공식 기록은 대한민국 정책브리핑에 올라 있는 류제명 2차관 브리핑입니다. 같은 날 숫자는 뉴시스 종합이 옮겼고, 통과 팀 입장은 연합뉴스가 전했습니다. 과기정통부 누리집 보도자료 원문은 이 글을 쓰는 시점에 열리지 않았기 때문에, 아래 내용은 브리핑 전문과 통신 보도에 나온 사실만 정리합니다.
무엇이 실제로 발표됐나
2차 단계평가는 네 팀을 대상으로 진행됐고, 다음 단계 진출 팀으로는 업스테이지, SK텔레콤, LG AI연구원이 발표됐습니다. 여기서 중요한 점은 이 순서가 종합 1, 2, 3등을 뜻하지 않는다는 것입니다. 차관은 항목마다 1등이 달랐고, 한 팀이 모든 항목에서 일관되게 1등을 한 것은 아니라고 설명했습니다. 팀별 총점표도 공개되지 않았습니다.
발표된 세 팀의 순서는 발표 순서일 뿐, 종합 순위를 뜻하지 않습니다.
배점 구조는 공개됐습니다. 벤치마크 40점, 전문가 35점, 사용자 25점으로 총 100점입니다. 벤치마크 40점은 다시 아티피셜 애널리시스 AAII 25점, 한국지능정보사회진흥원 NIA 벤치마크 15점으로 나뉩니다. 사용자 25점은 AI 전문 사용자와 일반 국민이 모델을 직접 사용하며 비교한 항목이며, 브리핑에는 일반 국민 평가에 185명이 참여했다는 숫자가 나옵니다.
이 구조만 봐도 벤치마크가 전부는 아니었습니다. 전문가와 사용자를 합치면 60점으로, 벤치마크 40점보다 큽니다.
이번 평가는 벤치마크 40점만으로 결정되지 않았고, 전문가와 사용자 평가가 합쳐 60점이었습니다.
과기정통부가 공개한 평균과 격차도 있습니다. 벤치마크 평균은 22.5점, 1위와 4위 격차는 4점이었습니다. 전문가 평균은 28.8점, 격차는 2.4점이었고, 사용자 평균은 17.6점, 격차는 5점이었습니다. 차관은 전반적으로 격차가 근소하다고 설명했고, 벤치마크에서는 총점 30점을 넘긴 팀이 없었다고도 말했습니다.
즉, 공개된 숫자는 배점과 평균, 항목별 격차까지입니다. 그 밖의 팀별 총점이나 항목별 세부 순위는 발표되지 않았습니다.
모티프테크놀로지스가 빠졌다는 사실을 어떻게 읽어야 하나
모티프테크놀로지스의 모티프 3은 뉴시스 보도에서 AAII 47점으로 소개됐습니다. 참여 세 팀보다 이 지표에서 앞섰다고도 전해졌습니다. 브리핑에서는 모티프 3이 미국·중국 밖 모델 가운데 세계 최고 성능을 기록했고, 글로벌 상위 10위권에 들었다고 설명했습니다. 또 4개 정예팀 모델은 모두 AAII 31점 이상이었고, 미국·중국·한국 모델만 40점을 넘겼다고 했습니다.
그런데도 모티프테크놀로지스는 종합 평가에서 다음 단계에 들지 못했습니다. 이 사실은 두 가지를 함께 보여줍니다. 하나는 특정 벤치마크 지표에서 앞선 성과가 실제로 있었다는 점이고, 다른 하나는 종합 평가는 그 한 지표만으로 결정되지 않았다는 점입니다.
벤치마크 한 지표에서 앞선 사실과 종합에서 빠진 사실은 동시에 성립합니다.
따라서 이를 두고 벤치마크가 가짜라고 단정하는 것도, 반대로 남은 세 팀이 벤치마크에서 뒤졌다고 쓰는 것도 근거가 부족합니다. 차관은 벤치맥싱 의혹을 이번 평가에 반영하지 않았다고 했고, 아티피셜 애널리시스로부터 체계적인 암기나 과적합 단서를 찾지 못했다는 답변을 받았다고 설명했습니다. 공개되지 않은 팀별 점수와 순위를 상상으로 채우면 사실 관계가 흐려집니다.
통과한 세 팀에 대해 공개된 설명
전문가위원회 의견은 점수표가 아니라 문장 형태로 전해졌습니다. 업스테이지에 대해서는 포털 다음과 타임리 연계, 퓨리오사AI NPU 협업이 언급됐습니다. 국민이 체감할 서비스 환경과 국산 가속 칩 협업이 함께 강조된 셈입니다.
SK텔레콤에 대해서는 수리 추론과 한국어 역량이 언급됐습니다. 뉴시스는 여기에 다국어와 대규모 응용 체계의 활용성, 분야 특화 AX K1, 제조 산업 특화 에이전트 실증, 세무 분야 적용 가능성을 덧붙였습니다. 브리핑은 국방·제조 등 산업 적용과 상용 서비스 탑재를 말합니다.
LG AI연구원에 대해서는 국제기구 협업, 에이전틱 AI, 신뢰성 확보와 위험 관리가 언급됐습니다.
세 팀 설명에서 공통으로 보이는 것은 실제 사용처와 적용 경로입니다. 반대로 공통으로 없는 것은 벤치마크 등수 한 줄입니다. 이번 발표를 읽을 때도 이 차이를 같이 보는 것이 좋습니다.
아직 끝난 것이 아닌 이유
이번 발표는 최종 2팀을 뽑은 결과가 아닙니다. 남은 팀은 세 팀이고, 3차에서 2팀을 고르는 일정이 남아 있습니다. 차관은 이의 절차를 거친 뒤 3개 팀과 협의해 3차 배점과 일정을 빠르게 확정하겠다고 밝혔습니다. 원래 설계도 3차에서 2팀을 고르고, 그 2팀이 2027년에 이어 가는 구조입니다.
8월 18일은 최종 선정일이 아니라 2차 단계평가 결과가 나온 날입니다.
하반기 GPU 지원 확대도 함께 언급됐습니다. 뉴시스는 상반기 B200 768장 수준에서 하반기 1000장 수준으로 늘린다고 적었습니다. 다만 이 숫자는 뉴시스 출처에 있는 내용이며, 브리핑 전문에는 768과 1000이라는 장수 숫자가 직접 나오지 않습니다. 브리핑은 고성능 GPU 지원 확대 방침을 말합니다.
무엇과 혼동하면 안 되나
이번 소식은 솔라 프로 4의 오픈라우터 등재와는 다른 이야기입니다. 업스테이지라는 이름이 두 소식에 모두 등장하더라도, 8월 14일 등재와 8월 18일 2차 단계평가는 날짜도 다르고 대상도 다릅니다. 상용 API 등재와 국가 선발 2차를 한 제목 아래 묶어 쓰면 사실 관계가 흐려집니다.
또한 이번 결과를 두고 모티프테크놀로지스가 실력이 없어서 빠졌다고 해석하는 것도 맞지 않습니다. AAII 47점과 글로벌 상위 10위권이라는 설명은 브리핑과 보도에 남아 있는 사실입니다. 반대로 남은 세 팀이 벤치마크에서 졌다고 쓰는 것도 근거가 없습니다. 팀별 벤치마크 점수와 종합 순위는 공개되지 않았기 때문입니다.
사용자 25점이 혼자 합격을 갈랐다고 보는 해석도 조심해야 합니다. 사용자 항목의 격차가 가장 컸던 것은 맞지만, 종합 평가는 세 항목의 합입니다. 차관 역시 결정적 한 항목으로 보기 어렵다고 설명했습니다.
DAKER 커뮤니티가 가져갈 포인트
이번 발표에서 가장 먼저 읽어야 할 것은 순위표가 아니라 배점 구조입니다. 벤치마크 40점, 전문가 35점, 사용자 25점이라는 공개된 틀 안에서, 벤치마크 한 지표가 앞선 팀이 종합에서 빠졌습니다. 이 사실만으로도 성능 숫자와 실제 사용 경험을 함께 준비해야 한다는 메시지는 충분히 분명합니다.
성능 숫자만으로는 부족했고, 실제 사용 경로와 평가 경험이 함께 반영됐습니다.
해커톤이나 제품 제출 관점으로 옮겨 보면 더 선명합니다. 성능 수치만 있는 화면은 벤치마크 40점 구간에 가까울 수 있습니다. 반면 다른 사람이 다시 열어 보고, 실제로 써 보고, 어디서 막히는지 확인할 수 있는 링크는 전문가와 사용자 평가가 붙는 영역에 더 가깝습니다. 이번 2차 결과를 과장된 우승 서사로 소비하기보다, 공개된 배점이 무엇을 요구했는지 읽는 편이 실질적입니다.
정리하면 기록은 짧아도 됩니다. 날짜는 8월 18일, 사건은 2차 단계평가, 남은 팀은 셋, 빠진 팀은 모티프테크놀로지스, 배점은 40·35·25, 그리고 3차에서 2팀을 고른다는 점입니다. 이 여섯 가지를 정확히 적는 것만으로도 같은 소식을 최종 우승처럼 과장하는 실수를 줄일 수 있습니다.
참고 자료
정책브리핑 독파모 2차 단계평가 결과
뉴시스 종합
연합뉴스 통과 팀 입장
이번 2차 결과에서 가장 중요하게 봐야 할 지점은 무엇이라고 느끼셨나요?