HiveTraceGuard-Pro: 0.6B 가드레일의 성능을 볼 때 함께 봐야 할 숫자들 | DAKER 커뮤니티

작은 가드레일 모델이 실제 운영에 들어올 수 있는지 판단할 때는, 눈에 띄는 재현율 하나만으로는 부족합니다. 특히 프롬프트 주입과 탈옥 대응처럼 오탐과 지연이 바로 제품 경험에 영향을 주는 영역에서는, 성능표를 읽는 방식 자체가 중요합니다.

2026년 9월 1일 arXiv에 올라온 HiveTraceLab의 HiveTraceGuard-Pro는 이런 점에서 한 번 더 볼 만한 사례입니다. Qwen3-0.6B를 LoRA로 맞춘 뒤 병합한 0.6B 생성형 가드레일로, 러시아어와 영어를 다루며 safe/unsafe 이진 판정을 내립니다. 다만 이 모델을 볼 때는 러시아어 주입 재현율 0.999만 따로 떼어 보기보다, 학습 중복, FPR, 지연을 같은 맥락에서 함께 읽는 것이 좋습니다.

0.6B 가드레일로 러시아어 주입 공격도 잡습니다

논문은 2026-09-01 arXiv에 올라왔습니다. 초록은 arXiv:2609.01046에서 확인할 수 있습니다. 영문 제목은 HiveTraceGuard-Pro: A Compact Generative Guardrail for Prompt Injection, Jailbreaks, and Adversarial Obfuscation입니다. 저자는 Nikita Oblakov, Sabrina Sadiekh, Evgeniy Kokuykin (HiveTraceLab)입니다. PDF는 같은 번호의 pdf입니다. 가중치·카드는 Hugging Face hivetrace/HiveTraceGuard-Pro에 공개되어 있습니다. 이 글은 제공된 사실과 초록·본문에서 확인한 범위만 옮깁니다.

0.6B 생성형 가드레일이라는 점

HiveTraceGuard-Pro는 Qwen3-0.6B에 LoRA를 적용한 뒤 병합한 생성형 가드레일입니다. 출력은 safe/unsafe 한 토큰 판정이며, 러시아어와 영어 입력을 다룹니다. 위협 모델에는 프롬프트 주입, 탈옥, 표면 난독화가 포함됩니다.

이 모델은 작은 크기의 보조 가드레일을 프로덕션 앞단에 두는 용도를 겨냥합니다.

학습 코퍼스는 같은 주제의 유해·무해 쌍을 맞추고, 여덟 가지 난독화 변환을 양쪽 라벨에 적용했다고 설명합니다. 다만 공개 범위는 가중치까지입니다. 코퍼스와 평가 코드는 비공개이므로, 완전 재현 가능한 학습 패키지로 보기는 어렵습니다.

라이선스는 Apache-2.0입니다. 배포 가능한 가중치가 공개되어 있다는 점은 실무에서 바로 시험해 보기 좋지만, 데이터와 평가 하니스가 닫혀 있다는 점은 별도로 적어 두는 편이 정확합니다.

눈에 띄는 성능과 함께 봐야 할 숫자

19개 벤치 그룹 집계 키는 0.7432입니다. 같은 하니스에서 더 높은 키는 0.7641과 0.7552입니다. 공개 16그룹만으로 다시 계산하면 0.7153이고, 34개 중 4개가 더 높습니다. 즉 어떤 그룹 집합을 기준으로 보느냐에 따라 순위 해석이 달라집니다.

집계 키 0.7432와 공개 16그룹 키 0.7153은 같은 숫자가 아니며, 같은 문맥에서 그대로 섞어 쓰기 어렵습니다.

15모델 비교에서는 클린 러시아 combined-F1이 0.88로 가장 높고, 러시아 프롬프트 주입 재현율은 0.999입니다. 중앙 지연은 14.3ms로 그 실행에서 15모델 중 최저입니다. 스위트 집계 FPR은 0.268, FNR은 0.156입니다.

여기서 중요한 점은 러시아어 주입셋이 팀 제작셋이며, 학습 중복이 최소 27.1%라는 사실입니다. 따라서 재현율 0.999는 분명 강한 수치이지만, 일반화 성능을 해석할 때는 중복 정보를 함께 붙여야 합니다.

재현율만 크게 적기보다 중복, 지연, FPR을 같은 표에 두는 편이 이 모델을 더 정확하게 보여줍니다.

운영에 옮길 때 확인할 부분

이 모델을 제품에 붙일 때는 요청 가드와 응답 가드를 같은 가중치로 돌릴지부터 정리하는 것이 좋습니다. HiveTraceGuard-Pro는 이진 판정만 내리므로, 카테고리 라벨이 필요한 환경이라면 별도 분류기가 필요합니다.

또한 지연 14.3ms는 해당 하니스의 단일 요청 중앙값입니다. 이를 그대로 동시 처리량이나 서비스 SLA로 바꿔 적기는 어렵습니다. 응답 쪽 숫자는 레거시 단독 응답 직렬화를 사용했으므로, 실제 배포 템플릿과 동일한 경로라고 단정하지 않는 편이 맞습니다.

오탐 비용도 따로 봐야 합니다. 스위트 집계 FPR 0.268은 제품 정책과 바로 연결되는 수치이기 때문에, 러시아어·영어 트래픽 비율과 함께 도메인 로그에서 다시 재는 과정이 필요합니다. 논문도 영어 일반 모더레이션, 강한 난독화, 응답 정밀도에서는 약점이 있다고 적고 있습니다.

이 모델을 과장 없이 읽는 법

이 결과는 19개 그룹에서 1등이라는 뜻이 아닙니다. 0.7432는 상위 두 모델 뒤에 있으며, 공개 16그룹 기준으로는 4개 모델이 앞섭니다.

러시아 주입 재현율 0.999 역시 학습과 무관한 일반화의 보증으로 읽기 어렵습니다. 팀 제작셋이고, 최소 27.1%의 학습 중복이 있습니다.

모든 언어와 모든 응답 경로에서 같은 성능을 보인다는 뜻도 아닙니다. 강조된 평가는 러시아어 강건성에 있고, 응답 벤치는 레거시 직렬화 기준입니다.

마찬가지로 코퍼스까지 공개된 완전 재현 패키지도 아닙니다. 공개된 것은 Apache-2.0 가중치이며, 코퍼스와 평가 코드는 비공개입니다.

작은 모델이라는 점은 장점이지만, 0.6B라는 크기만으로 안전성을 설명할 수는 없습니다.

참고 자료

arXiv:2609.01046
PDF
Hugging Face hivetrace/HiveTraceGuard-Pro

여러분이라면 이런 가드레일을 검토할 때 재현율, 오탐, 지연, 데이터 중복 가운데 무엇을 가장 먼저 확인하실지 궁금합니다.