TypeSafe Jev 시리즈 9/10 — confidence는 확률과 어떻게 다를까 | DAKER 커뮤니티

모델이 어떤 답을 냈는지만 보면, 그 답을 얼마나 믿어도 되는지는 놓치기 쉽습니다. 특히 자동 실행과 사람 검토를 나눠야 하는 시스템이라면, 정답 후보보다 확신의 정도가 더 중요해지는 순간이 있습니다.
이번 글은 TypeSafe의 confidence가 무엇을 뜻하는지, 단순한 확률과는 어떻게 다른지, 그리고 시스템 행동을 나눌 때 왜 유용한지 정리합니다.
확률 분포의 모양을 한 숫자로 접는 값
Score·Choice 답에는 옵션 또는 수준에 걸친 probabilities가 있습니다. 확률이 한 결과에 모이면 확신 있는 답이고, 여러 결과에 퍼지면 불확실한 답입니다. confidence는 이 분포의 모양을 0–1 사이 숫자 하나로 접어, 임계값 기준으로 다루기 쉽게 만든 값입니다. Noul에는 없습니다.
confidence는 확률 분포의 모양을 0–1 한 숫자로 요약해 임계값 기반 제어에 쓰기 쉽게 만든 신호입니다.
confidence는 파생 통계입니다
confidence는 새로 만들어낸 별도 판단이 아니라, 이미 있는 확률 분포에서 계산한 통계입니다. TypeSafe는 Choice·Score마다 이 값을 돌려줍니다. 기본값으로 쓰기 좋지만, 반드시 이 정의에만 묶일 필요는 없습니다. 다른 기준이 더 적절하다면 전체 probabilities를 직접 활용하면 됩니다.
Choice에서 낮은 confidence는 뚜렷한 승자가 없다는 뜻인 경우가 많습니다. Score에서는 수준이 애매하거나, 판단 기준이 다차원이거나, state 정보가 부족할 때 낮게 나오는 경우가 많습니다.
모르겠다는 신호가 중요한 이유
문서의 표현대로, 정직한 불확실성을 표현하지 못하면 시스템을 믿기 어렵습니다. confidence는 모델이 이 건은 확신이 없다고 드러낼 수 있게 하는 장치이며, 신뢰 가능한 시스템의 기초가 됩니다.
정직한 불확실성을 표현하지 못하면 시스템을 믿을 수 없습니다.
confidence로 행동을 세 갈래로 나누기
confidence는 단순히 참고용 숫자에 그치지 않고, 시스템 행동을 나누는 기준으로 쓸 수 있습니다. 보통은 높은 경우 자동 실행, 중간은 확인·검토·추가 정보 요청, 낮은 경우는 실행하지 않고 사람이나 다른 시스템으로 넘기는 식입니다. 다만 경계값은 언제나 이해관계와 위험도에 따라 달라집니다.
높은 confidence — 자동 실행
중간 — 확인·검토·추가 정보
낮은 — 실행하지 않음. 사람·명확화·다른 시스템으로
위험도에 따라 임계값도 달라져야 합니다
같은 시스템 안에서도 모든 행동에 같은 임계값을 쓰는 것은 적절하지 않을 수 있습니다. 문서 예시에서는 confidence < 0.5면 사람에게 라우팅하고, 잔액 조회처럼 위험이 낮은 작업은 바로 진행하며, 이체 승인처럼 위험이 높은 작업은 confidence > 0.9일 때만 확인 후 실행합니다.
올바른 숫자는 도메인과 모델 성능에 따라 달라집니다. 그래서 처음에는 보수적으로 시작하고, 실제 데이터로 조정해 가는 것이 좋습니다.
정리
confidence는 확률 자체를 대체하는 값이 아니라, 확률 분포를 운영 가능한 신호로 바꿔 주는 요약값입니다. 특히 자동화 수준을 조절해야 하는 시스템에서는, 답이 무엇인지뿐 아니라 얼마나 확신하는지를 함께 보는 것이 중요합니다.
참고 자료
https://docs.typesafe.ai/confidence (.md)
이전: 8/10 yes 확률 하나면 충분 · 다음: 10/10 코드가 통제하는 AI 워크플로
여러분의 서비스에서는 어떤 작업부터 confidence 임계값을 다르게 두는 것이 적절해 보이나요?