GPT-4 공동저자가 말한 RLHF 이후: 보조를 넘어 자동화로 가는 TypeSafe·Jev의 방향 | DAKER 커뮤니티

지금의 LLM은 놀라울 만큼 많은 벤치마크를 통과하지만, 정작 업무 현장에서는 중요한 결정을 끝까지 맡기기 어렵다는 말이 자주 나옵니다. 이 간극이 왜 생기는지 궁금했다면, 이번 강연은 그 이유를 비교적 선명하게 짚어줍니다.

Tech Bridge가 자막으로 옮긴 AI Engineer World's Fair 강연 「GPT-4 공동 저자가 밝히는 RLHF를 버리고 'Jev'를 만든 진짜 이유입니다」에서 연사는 지금까지의 LLM이 잘하도록 설계된 일과, 앞으로 풀어야 할 일이 서로 다르다고 설명합니다. 영상과 설명란에서 확인되는 범위만 바탕으로, 핵심만 읽기 쉽게 정리합니다. 연사는 자막에서 Diego Mida, 채널 소개에서는 디오고(지오구) 알메이다(Diogo Almeida)로 표기됩니다.

RLHF 다음 자동화 —

보조와 자동화는 목표부터 다릅니다

강연의 출발점은 단순합니다. 한쪽에서는 AI가 이미 대단한 성과를 내고 있다고 말하고, 다른 쪽에서는 여전히 채팅 앱이나 코딩 보조 수준에 머문다고 평가합니다. 연사는 이 두 시각이 서로 완전히 틀린 것이 아니라, 서로 다른 문제를 보고 있기 때문에 동시에 맞을 수 있다고 봅니다.

어려운 문제를 잘 푸는 능력과 사람을 루프에서 빼는 능력은 같은 것이 아닙니다

연사의 설명에 따르면, 지금의 LLM은 사람을 만족시키고 설득하는 과제에는 강합니다. 반면 고객지원처럼 겉으로는 쉬워 보이는 일도, 실제로는 사람 없이 끝까지 처리해야 하는 자동화 문제로 바뀌는 순간 훨씬 어려워집니다. 그래서 벤치마크 성능이 높아져도 실무 자동화가 곧바로 따라오지 않는다는 것입니다.

RLHF가 강한 영역은 왜 보조인가

연사는 사용량 기준으로 거의 모든 LLM이 RLHF로 학습됐다고 말합니다. 요지는 인간 선호를 모으고, 그 선호에 맞게 모델을 최적화하는 방식이라는 점입니다. 이 구조에서는 사람이 무엇을 좋아하고 신뢰하는지가 핵심 기준이 됩니다.

모델에 사람이 계속 필요한 이유는 우리가 사람을 루프에 넣도록 만들었기 때문입니다

이 관점에서 보면, RLHF는 본질적으로 보조에 강한 체계입니다. 사람이 결과를 보고 괜찮다고 느끼는 답, 그럴듯하고 유용해 보이는 답을 잘 만드는 데 적합하기 때문입니다. 연사는 여기서 보상 모델의 비대칭도 언급합니다. 틀려도 맞아 보이게 말하는 과대약속이 설계상 특징처럼 나타날 수 있다는 뜻입니다.

또 업무 현장에서 반복적으로 보이는 패턴도 짚습니다. 사업상 리스크가 큰 결정은 AI에 맡기지 않으면서도, 그 과정에서 생기는 비용이나 불편은 사용자 쪽으로 넘기는 관행이 있다는 것입니다. 이 지점에서 연사는 현재의 보조형 AI가 실제 책임 구조와 어떻게 연결되는지 비판적으로 바라봅니다.

왜 다음 단계가 Claude Code의 확장이 아니라고 보나

강연은 흔히 떠올릴 수 있는 결론, 즉 다음 시대가 더 강력한 코딩 보조 도구의 시대일 것이라는 예상도 스스로 거둬들입니다. 연사에 따르면 Claude Code 역시 같은 보조 시대, 같은 RLHF 계열의 연장선에 있습니다. 순수 RLVR이라면 형태가 달라질 수는 있지만, 그것만으로 자동화 축이 더해지는 것은 아니라는 입장입니다.

여기서 말하는 다음 단계는 단순히 소프트웨어를 더 싸게 다시 쓰는 일이 아닙니다. SaaS 블록 자체가 더 똑똑해지고, 사람의 개입 없이도 신뢰 가능한 방식으로 작동하는 자동화에 가깝습니다.

더 나은 보조가 아니라 신뢰 가능한 자동화가 다음 과제입니다

TypeSafe가 제시하는 제3의 방향

연사는 사전학습 자체를 문제로 보지 않습니다. 오히려 사전학습은 훌륭하며, 문제는 그 지능을 실제로 꺼내 쓰는 방식에 있다고 말합니다. 환각 역시 인간 선호 최적화와 맞닿아 있다고 봅니다.

이 맥락에서 TypeSafe는 포스트트레이닝의 목표를 RLHF나 RLVR만으로 보지 않습니다. 강연에서 제시되는 표현은 보정된 의사결정(calibrated decision-making)입니다. 인간 선호를 맞추는 것, 혹은 순수 정답 기준으로만 밀어붙이는 것과는 다른 북극성을 세우겠다는 뜻으로 읽힙니다.

TypeSafe는 보정된 의사결정을 제3의 목표로 둡니다

연사는 API 형태도 다를 것이라고 말하며, 곧 공개할 예정이라고 설명합니다. 함께 메일링 리스트, 채용 페이지, CompleteSkeptic 계정도 안내합니다. 제품명 Jev는 채널 제목과 소개에서 쓰이지만, 이 강연 본문은 특정 제품 설명보다 패러다임 전환과 TypeSafe의 비전에 더 무게를 둡니다.

이 강연을 지금 읽을 이유

이 강연의 핵심은 RLHF를 전면 부정하는 데 있지 않습니다. 오히려 RLHF가 무엇에 강한지 인정한 뒤, 그 강점을 자동화 능력으로 오해하지 말자는 경고에 가깝습니다. 지금의 AI가 왜 인상적인 데모와 제한적인 실무 적용 사이를 오가는지 이해하는 데 도움이 되는 관점입니다.

특히 팀이나 조직에서 AI를 도입할 때, 지금 만들고 있는 것이 사람을 돕는 도구인지, 사람 없이 돌아가야 하는 자동화인지 먼저 구분해 보는 것이 좋습니다. 이 강연은 바로 그 구분이 왜 중요한지 설명합니다.

참고 자료

지금의 AI를 보조 도구로 보고 계신지, 아니면 자동화의 출발점으로 보고 계신지 궁금합니다.