122개 스킬 라우팅, 작은 오픈 모델로 어디까지 되나: Laya 파인튜닝 실험 정리 | DAKER 커뮤니티
한 줄 답: Tonbi's AI Garage 영상(2026-09-28) 기준, Hermes Agent에 스킬 122개를 붙인 뒤 Laya(오픈 웨이트 결정 모델)를 파인튜닝해 스킬 후보를 먼저 줄이는 실험입니다. 숫자는 제작자 단일 에이전트 기록 실험이며 공인 벤치마크가 아닙니다.
Tonbi's AI Garage가 2026년 9월 28일에 올린 영상 「Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing」(https://www.youtube.com/watch?v=iwdzdpCRlBs)은 바로 이 지점을 실험합니다. Jev 스타일의 오픈 웨이트 결정 모델 Laya를 실제 에이전트 기록에 맞춰 파인튜닝했을 때, 스킬 후보를 얼마나 잘 좁혀 주는지 비교한 내용입니다.
먼저 짚을 점도 있습니다. 이 글의 숫자는 모두 영상 제작자가 자기 에이전트 하나의 대화 기록으로 진행한 실험 결과입니다. 별도 검증 벤치마크는 아니며, 영상 앞부분 요약과 본 실험 화면의 숫자도 조금씩 달라 이 글에서는 각 실험 화면에 나온 숫자를 따랐습니다. 또한 제작자도 이 방식이 최종 스킬 선택을 대체하는 것이 아니라, 후보 목록을 줄이는 실험이라고 설명합니다.
왜 스킬 선택에 작은 모델을 쓰려는가
제작자는 https://github.com/NousResearch/hermes-agent 기반 Hermes Agent에 스킬 122개를 붙여 사용하고 있습니다. 현재는 대화를 이끄는 최상위 모델이 매번 이 전체 목록을 보고 스킬을 고릅니다. 제작자는 이 과정이 꼭 최고 수준의 추론 능력을 요구하는 일은 아닐 수 있다고 봅니다.
작고 빠른 결정 모델이 먼저 후보를 3개나 10개로 추려 주면, 큰 모델은 122개 전체가 아니라 그 안에서만 고르면 됩니다.
이 관점이 성립하면 비용과 지연 시간을 줄일 여지가 생깁니다. 특히 호출이 반복되는 에이전트 구조에서는, 이런 중간 단계 최적화가 전체 운영비에 꽤 큰 차이를 만들 수 있습니다.
Laya는 어떤 모델인가
Laya는 Convai Innovations가 공개한 모델입니다. 소스와 문서는 GitHub(https://github.com/NandhaKishorM/laya)에, 모델 카드와 체크포인트는 Hugging Face(https://huggingface.co/convaiinnovations/laya)에 있습니다.
동작 방식은 Jev와 비슷합니다. 질문, 현재 상황, 여러 선택지를 받아 각 선택지에 점수를 매기고, 일반적인 생성형 응답은 하지 않습니다. 예를 들어 고객 문의를 넣으면 어느 부서로 보내야 하는지, 얼마나 급한지, 해지 의사가 있는지 같은 항목을 각각 확률 형태로 돌려주는 식입니다. 로컬에서 실행할 수 있어 데이터가 외부로 나가지 않는 점도 특징입니다.
영상 설명에 따르면, 질문과 상황, 선택지를 한 줄로 이어 붙이고 선택지마다 마스크 토큰을 하나씩 둡니다. ModernBERT-large 기반 28개 층이 전체 입력을 읽은 뒤, 새로 학습한 2개 층이 선택지들을 비교하고 마스크 위치마다 점수를 뽑아 확률로 바꿉니다. 다만 모든 선택지가 192~256토큰 정도의 자리를 나눠 쓰기 때문에, 선택지가 20개 안팎을 넘으면 구분이 흐려질 수 있다고 합니다. 영상에서는 Jev가 선택지를 255개까지 받는다고 비교합니다.
체크포인트는 영어용 1억 2,100만 파라미터, 다국어용 3억 2,200만 파라미터, 그리고 파인튜닝 버전이 있습니다.
Laya는 처음부터 바로 잘 쓰는 모델이라기보다, 특정 작업에 맞춰 빠르게 특화시키는 출발점에 가깝습니다.
제작자는 이 점을 특히 강조합니다. Laya 쪽 자료에서도 학습 전 0.36이던 점수가 파인튜닝 후 0.77로 오른다고 소개하며, 공개된 Jev 비교 수치 역시 Laya 측에서 제시한 숫자일 뿐 별도 검증 결과는 아니라고 짚습니다.
실험 1: 학습 없이 바로 비교한 결과
시험 데이터는 텔레그램으로 나눈 긴 대화 한 세션으로, 실제 메시지 364개입니다. 각 메시지마다 122개 스킬 전체를 대상으로 이 스킬을 불러와야 하는지를 한 번에 물었고, 정답은 에이전트가 실제로 호출한 스킬이었습니다. 한 번 호출에 Jev는 API로 약 0.25초, Laya는 로컬에서 약 0.5초가 걸렸다고 합니다.
결과는 Jev가 확실히 앞섰습니다. Jev는 상위 3개 안에 실제 스킬이 들어간 비율이 73%, 상위 10개로 넓히면 84%였습니다. 반면 학습하지 않은 Laya는 상위 3개가 33%, 상위 10개가 55%였습니다. 무작위 선택보다는 분명 나았지만, 잘 쓰이지 않는 양자화 스킬 하나를 계속 1순위로 올리는 편향도 보였습니다.
실험 2: 한 세션으로 파인튜닝했을 때
다음 단계에서는 같은 세션의 8월 메시지 221개로 Laya를 학습시키고, 한 번도 보지 않은 9월 메시지 143개로 평가했습니다.
이 실험에서 1순위 적중률은 Jev 59%, 학습 전 Laya 18%, 파인튜닝한 Laya 35%였습니다. 학습 전과 비교하면 거의 두 배 가까이 오른 셈입니다. 상위 3개 적중은 41%에서 56%로, 상위 10개 적중은 79%까지 올라 Jev에 가까워졌습니다.
또 하나 눈에 띄는 변화는 과잉 예측이 줄었다는 점입니다. 학습 전에는 메시지마다 스킬 30개 정도를 필요할 것 같다고 표시하는 경향이 있었는데, 파인튜닝 뒤에는 이런 습관이 사라졌다고 합니다. 다만 대부분의 메시지는 사실 스킬이 필요 없는 경우가 많고, 이런 상황을 맞히는 능력은 Jev가 더 나았다고 설명합니다.
실험 3: 전체 세션으로 더 크게 학습한 결과
마지막으로 제작자는 이 에이전트의 모든 세션에서 학습 질문 12,144개를 만들고, 300개는 확신도 보정용으로 따로 떼어 둔 채 다시 학습했습니다. 학습에는 DGX Spark를 사용했고, 한 시간 넘게 걸렸다고 합니다.
이 경우 상위 3개 적중률은 56%에서 71%로 올라 같은 조건의 Jev 79%에 꽤 가까워졌습니다. 1순위 적중도 35%에서 44%로 상승했습니다.
전체 세션으로 학습한 Laya는 상위 3개 적중률 71%까지 올라, Jev 79%에 근접했습니다.
다만 모든 지표가 함께 좋아진 것은 아닙니다. 상위 10개 적중은 오히려 떨어졌고, 학습 데이터가 길어진 영향인지 속도도 느려졌다고 합니다.
이 실험이 보여 주는 것
제작자의 결론은 분명합니다. 바로 가져다 쓰는 스킬 라우터로는 Jev가 여전히 더 낫습니다. 하지만 Laya는 자기 데이터로 파인튜닝했을 때, 무료로 로컬에서 돌리면서 122개 스킬을 10개 안팎의 후보로 줄여 주는 도구가 될 가능성을 보여 줍니다.
즉, 최상위 모델을 완전히 대체하는 이야기가 아니라, 큰 모델이 보기 전에 후보를 먼저 좁히는 전처리 계층으로 쓸 수 있느냐의 문제에 가깝습니다. 에이전트를 운영하면서 이 판단까지 큰 모델이 해야 하나 싶은 구간이 있다면, 이런 작은 결정 모델을 붙여 보는 실험이 의미 있을 수 있습니다.
출처
- YouTube, Tonbi's AI Garage — Laya: Fine-tuning the Open Jev-style Decision Model on Skill Routing: https://www.youtube.com/watch?v=iwdzdpCRlBs
- Laya GitHub: https://github.com/NandhaKishorM/laya
- Hugging Face — convaiinnovations/laya: https://huggingface.co/convaiinnovations/laya
- Hermes Agent (NousResearch): https://github.com/NousResearch/hermes-agent