Modelpedia가 보여준 것: 흩어진 모델 연구 결과를 검색 가능한 카탈로그로 모으는 방법 | DAKER 커뮤니티
모델을 평가하는 자료는 넘치지만, 정작 모델이 어떤 상황에서 실패하고 어떤 행동을 보였는지는 논문과 기술 보고 곳곳에 흩어져 있는 경우가 많습니다. 점수표는 쉽게 모이지만, 관찰과 해석은 검색하기 어렵다는 뜻입니다.
2026년 9월 1일 CredibleAI 등이 arXiv에 공개한 Modelpedia는 바로 이 지점을 겨냥합니다. 논문 속 모델 관련 finding을 LLM 보조로 추출해 모델·데이터셋·방법·개념·출처에 연결하고, 이를 검색 가능한 공개 카탈로그로 모으는 시도입니다.
산재한 모델 행동·실패 보고를 검색 가능하게 만드는 것이 Modelpedia의 목표입니다.
논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.01090에서 볼 수 있고, 영문 제목은 Modelpedia: A Catalog of Model Findings for the Meta-Science of AI입니다. 저자는 Franciszek Bernat, Dawid Płudowski 외 (CredibleAI)입니다. PDF는 같은 번호의 pdf, 코드는 GitHub CredibleAI/modelpedia에 공개되어 있습니다. 이 글은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다.
Modelpedia는 무엇을 모으는가
논문이 다루는 대상은 새 모델을 만드는 일만이 아닙니다. 이미 공개되거나 널리 쓰이는 모델을 조사해, 어떤 행동을 보이는지, 어떤 실패 모드가 나타나는지, 어떤 조건에서 성능이 달라지는지를 밝히는 연구도 많습니다. 다만 이런 관찰은 논문·블로그·기술 보고에 흩어져 있어 한곳에서 찾기 어렵습니다.
Modelpedia는 이 흩어진 finding을 카탈로그로 모읍니다. 논문에서 모델에 대한 finding을 추출하고, 이를 모델 변형, 평가 데이터셋, 사용 방법, 개념, 원출처와 연결합니다. 관련 연구 링크도 둘 수 있습니다.
모델 카드가 제작자 문서에 가깝다면, Modelpedia의 finding은 제3자 논문이 남긴 관찰을 모으는 층에 가깝습니다.
논문에 따르면 프로토타입은 ICLR 2024·2025 채택 논문에 적용되어 finding 1000개 이상을 추출했다고 보고합니다. 이 카탈로그는 단순한 저장소를 넘어 메타분석의 대상이 되기도 합니다. 어떤 모델과 데이터셋에 연구 관심이 몰리는지, 어떤 종류의 증거가 많이 축적되는지도 함께 볼 수 있기 때문입니다.
어떻게 추출하고 연결하는가
본문에 따르면 수집 과정은 OpenReview API로 논문을 모으는 단계에서 시작합니다. 이후 초록·리뷰 키워드로 관련성을 점수화하고, 상위 약 15%를 LLM 추출 단계에 넣습니다. 추출 과정에서는 인용 구를 강제해 환각을 줄이려 했고, 엔티티는 기존 레지스트리와 매칭합니다. 또 별도 LLM 검증기로 finding을 확인했다고 적고 있습니다.
각 finding은 최소한 모델 변형, 평가 데이터셋, 사용 방법, 개념, 원출처에 연결됩니다. 여기서 개념은 failure mode나 shortcut 같은 범주를 가리킵니다. 증거 유형은 observational·interventional·correlational로 나뉩니다.
finding을 모델·데이터셋·방법·개념·출처로 나누어 적으면, 단순한 실패 보고보다 훨씬 검색 가능하고 비교 가능한 기록이 됩니다.
사이트에서는 finding 페이지를 열어 요약·주의·키 지표를 읽을 수 있고, 코드 저장소에는 스크리닝·프롬프트·데이터 구조가 공개되어 있습니다.
카탈로그를 메타분석 대상으로 보면
Modelpedia는 finding을 모으는 데서 그치지 않고, 그 분포 자체를 분석합니다. ICLR 2025 기준 메타분석에서는 언어·비전-언어 모델 조사가 많고, Llama·GPT·Mistral 계열에 관심이 모인다고 봅니다. 비전 평가는 ImageNet·COCO에 치우치고, 언어 벤치는 더 다양하다고 적습니다.
증거 유형에서도 쏠림이 보입니다. correlational 증거가 많고 observational·interventional은 상대적으로 적습니다. 개입 실험은 가중치 접근이 필요해 오픈웨이트 모델에서 더 많이 나타난다고 설명합니다.
이 숫자들은 리더보드가 아니라, 카탈로그에 쌓인 finding의 분포를 보여줍니다.
그래서 이 메타분석은 순위를 매기기 위한 자료라기보다, 연구 커뮤니티가 무엇을 자주 보고 무엇을 덜 보는지 점검하는 도구에 가깝습니다.
실무 문서에 옮길 때 유용한 점
이 작업이 바로 제품 문서나 팀 위키로 이어지는 것은 아니지만, 기록 방식에는 참고할 점이 분명합니다. 모델 행동이나 실패를 이슈 한 줄로 남기기보다, 모델·데이터셋·방법·개념·출처를 분리해 적으면 이후 검색과 비교가 쉬워집니다. 여기에 observational·interventional·correlational 같은 증거 유형 칸을 더하면 기록의 성격도 함께 남길 수 있습니다.
원문이 강조하는 한계도 함께 기억할 필요가 있습니다. finding 1000개 이상이라는 숫자는 ICLR 2024·2025에 적용한 프로토타입 추출량입니다. 이를 곧바로 다른 조직의 내부 문서 규모와 비교해 과장해서 읽을 수는 없습니다.
추출된 finding은 논문 주장을 as-is로 모은 것이며, 진위 검증을 카탈로그가 보증하는 것은 아닙니다.
또 Modelpedia는 벤치마크의 대체재가 아닙니다. 벤치 점수를 없애는 것이 아니라, 점수표 바깥에 흩어진 모델 행동·실패 보고를 검색 가능하게 만드는 쪽에 가깝습니다. 그래서 문서를 만들 때도 벤치 표와 finding 표를 분리해 두는 편이 자연스럽습니다.
원문에 있던 실무적 메모를 한 줄로 정리하면 이렇습니다. 모델 카드와 제3자 finding을 한 칸에 섞지 말고, 출처 논문과 증거 유형을 나란히 적는 것이 좋습니다.
이 글이 말하는 범위
이 글은 Modelpedia가 모든 학회 finding을 이미 다 모았다고 소개하는 글이 아닙니다. 논문이 보고하는 범위는 ICLR 2024·2025 프로토타입과 finding 1000개 이상 추출입니다.
또 추출된 finding이 모두 사실로 검증되었다는 뜻도 아닙니다. 본문은 논문 주장을 as-is로 모으며, 진위 검증은 별도 과제라고 적습니다.
마찬가지로 특정 대회나 리더보드 성과를 알리는 글도 아닙니다. 공개 카탈로그와 코드, 그리고 이를 통한 메타과학적 관찰을 소개하는 내용입니다.
참고 자료
arXiv:2609.01090
PDF
https://credibleai.github.io/modelpedia
https://github.com/CredibleAI/modelpedia
여러분은 모델의 실패나 행동을 기록할 때 점수표와 별도로 finding 형식의 문서를 두는 방식이 얼마나 실용적이라고 보시나요?