DeepSeek-V4-Flash-Vision-Exp 공개: MIT 라이선스 가중치와 추론 코드에서 확인할 점 | DAKER 커뮤니티

멀티모달 모델 소식은 자주 나오지만, API 안내와 실제 가중치 공개는 의미가 다릅니다. 이번 DeepSeek 소식에서 중요한 지점은 실험 모델 소개 자체보다도, 공식 허깅페이스 저장소에 가중치와 토크나이저, 최소 추론 구현이 함께 올라왔다는 사실입니다.

특히 라이선스가 MIT로 명시되어 있고, README에 벤치마크 수치와 평가 설정, 입력 형식, 저장소 구성이 비교적 분명하게 적혀 있어 바로 확인할 수 있습니다. 다만 실험 모델이라는 성격, 내부 평가 수치라는 한계, image-text-to-text 범위라는 조건은 함께 읽는 것이 좋습니다.

이번 공개의 핵심은 API만 열린 실험 모델 소개가 아니라, 공식 저장소에 가중치·토크나이저·최소 추론 구현이 올라온 점입니다.

비전 가중치를 MIT로 풀었습니다

무엇이 공개됐나

DeepSeek가 허깅페이스 공식 계정에 올린 내용은 간단합니다. DeepSeek-V4-Flash-Vision-Exp 실험 멀티모달 모델의 가중치와 추론 참고 코드를 MIT 라이선스로 공개했습니다. 원문 저장소는 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp입니다.

모델 카드 생성 시각은 2026-08-31(UTC)입니다. 허깅페이스 모델 API의 createdAt은 2026-08-31T06:16:18.000Z입니다. 여기서 구분해야 할 점은, API 최초 안내 시점과 이번 가중치 공개 시점을 같은 날짜로 섞어 쓰지 않는 것입니다.

라이선스는 MIT이며, 모델 카드 생성 시각은 2026-08-31(UTC)입니다.

README는 이 모델을 DeepSeek-V4 계열의 첫 실험 멀티모달 모델로 소개합니다. DeepSeek-V4-Flash 구조에 시각 모듈을 넣고 추가 학습해 시각 이해를 열었다고 적고 있습니다. DeepSeek-V4-Flash-0731과 비교해 멀티모달 에이전트 능력은 크게 올랐고, 텍스트 전용 에이전트 과제는 비슷한 수준을 유지한다고 설명합니다.

모델 카드에서 먼저 봐야 할 정보

pipeline_tag는 image-text-to-text입니다. 카드 데이터와 태그에는 transformers, safetensors, deepseek_v4가 있습니다. README에는 영상 입력을 공식 지원한다고 적혀 있지 않으므로, 이 모델은 이미지와 텍스트 경로 중심으로 이해하는 편이 맞습니다.

허깅페이스 safetensors 메타의 total 파라미터 수는 304,646,824,126입니다. 모델 API의 safetensors.total 값이며, 약 3050억 파라미터라고 말할 때는 이 메타를 근거로 삼으면 됩니다. 다만 활성 파라미터 수나 가격 같은 정보까지 여기서 끌어내어 단정할 수는 없습니다.

이 모델은 image-text-to-text 태그를 달고 있으며, safetensors.total은 304,646,824,126입니다.

태그에 8-bit, fp8 등이 보일 수 있지만, 이를 공식 양자화 배포물로 바로 읽기는 어렵습니다. 커뮤니티 엔드포인트 호환 태그일 수 있으므로 실제 제공 파일은 siblings와 인덱스를 확인하는 것이 좋습니다.

또한 모델 이름에 Exp가 붙어 있다는 점도 중요합니다. 실험 모델이라는 뜻이며, 이를 제품 안정성 약속처럼 읽을 수는 없습니다. 장기적으로 고정된 모델 ID처럼 다루기보다 변경 가능성을 염두에 두는 편이 맞습니다.

README가 말하는 성능과 그 한계

README 벤치표 숫자는 다음과 같습니다. 텍스트 에이전트 쪽은 Terminal Bench 2.1 83.9, NL2Repo 57.7, Cybergym 75.3, DeepSWE 59.3, Toolathlon-Verified 75.9, DSBench-Hard 63.6, AutomationBench (Public) 25.7입니다. 멀티모달 쪽은 ApexBench Pass@1 36.5, Agents’ Last Exam 27.3, Chartography 64.3, ZeroBench Pass@5 35.0입니다. 같은 표에는 Opus-4.8 비교열도 있습니다.

이 수치는 DeepSeek가 README에 적은 내부 평가입니다. 독립 실험실 재현 완료나 외부 인증 결과처럼 바꾸어 쓰면 안 됩니다. 실제로 비교열을 보면 Vision-Exp가 앞서는 항목도 있고 뒤지는 항목도 함께 있습니다. 예를 들어 Agents’ Last Exam은 27.3 vs 25.7, ZeroBench는 35.0 vs 34.0이지만, NL2Repo는 57.7 vs 69.7입니다.

README의 벤치 수치는 내부 평가이며, 전 벤치 압도처럼 요약할 수는 없습니다.

평가 설정도 함께 적혀 있습니다. 텍스트 에이전트 벤치는 DeepSeek Harness 최소 모드, reasoning effort max, temperature 1.0, top_p 0.95입니다. 또 ApexBench와 Agents’ Last Exam에서는 Flash-0731이 입력의 멀티모달 요소를 무시했다는 각주가 있습니다. 점수만 떼어내기보다 조건과 각주를 함께 옮기는 것이 정확합니다.

텍스트 벤치에서도 모든 항목이 일괄 상승한 것은 아닙니다. 예를 들어 Cybergym은 75.3으로 Flash-0731의 76.7보다 약간 낮습니다. Chartography 64.3과 Opus-4.8 65.0처럼 근접한 항목도 있습니다. README의 메시지는 멀티모달 개선이 핵심이고, 텍스트는 comparable 수준을 유지한다는 쪽에 가깝습니다.

비전 가중치를 MIT로 풀었습니다

저장소 구성과 추론 경로

저장소에는 토크나이저, 프롬프트 인코딩 참고, 최소 PyTorch 추론 구현이 포함되어 있습니다. encoding/과 inference/가 나뉘어 있고, 비전 인코더·얼라이너, DFlash attention, MoE, Hyper-Connections, DSpark forward 경로를 다룬다고 적혀 있습니다. 대형 샤드는 model.safetensors.index.json으로 가리키며 소스 체크아웃에 중복하지 않는다고 설명합니다.

공개 범위에는 가중치뿐 아니라 토크나이저, 인코딩 예제, 최소 추론 구현이 함께 포함됩니다.

입력 형식은 OpenAI 스타일 JSON 콘텐츠 블록과 <image>path</image> TXT 표기를 모두 지원한다고 적혀 있습니다. inference/examples의 두 예제가 같은 프롬프트와 토큰 ID로 인코딩된다고 설명하므로, 재현 테스트를 할 때는 먼저 이 경로를 그대로 따라가는 편이 좋습니다.

상위 README는 inference/README.md를 가리킵니다. 따라서 transformers 태그가 있다고 해서 transformers만으로 즉시 로드된다고 단정하기보다, README와 inference 안내를 순서대로 확인하는 것이 안전합니다. 변환 없이 임의 로더로 가중치를 읽다가 실패했다면 공식 경로를 먼저 재현해 보는 편이 맞습니다.

이번 공개를 읽을 때 아닌 것들

이번 글은 큐웬 Flash-Next 뼈대 공개를 다루는 글이 아닙니다. 대상은 DeepSeek 공식 Vision-Exp 저장소입니다.

또한 API만 열린 8월 21일 실험 안내와 같은 각도로 읽을 일도 아닙니다. 이번에 확인하는 사실은 공식 허깅페이스 가중치와 코드 공개입니다. API 가격이나 이미지 토큰 상한처럼 README에 없는 숫자를 덧붙일 수는 없습니다.

벤치 점수가 독립 기관 인증을 뜻하는 것도 아닙니다. README는 DeepSeek Harness 설정과 자체 표를 제시하고 있으며, Opus-4.8 열도 같은 표 안의 참고 비교입니다.

영상·오디오까지 포함한 전 모달 발표도 아닙니다. 카드의 pipeline_tag는 image-text-to-text입니다. 지원하지 않는 입력을 지원하는 것처럼 적으면 사실과 어긋납니다.

커뮤니티 LoRA나 비공식 변환본이 공식 가중치라는 뜻도 아닙니다. 이번 링크는 deepseek-ai 네임스페이스의 공식 저장소입니다.

실제로 확인해 둘 포인트

다운로드 전에는 저장소의 lastModified와 커밋을 기록해 두는 것이 좋습니다. 2026-08-31 생성 이후 파일이 갱신될 수 있으므로, 재현 로그에 시각을 남겨 두면 이후 비교가 쉬워집니다.

공식 홈페이지·채팅·허깅페이스·X 배지가 README 상단에 나란히 있다는 점도 참고할 만합니다. 배포 채널을 확인할 때 deepseek.com, chat.deepseek.com, 공식 HF 배지를 함께 보면 비공식 미러와 구분하는 데 도움이 됩니다.

자체 호스팅을 검토한다면 디스크와 GPU 예산은 safetensors 인덱스와 total 메타를 기준으로 가늠하는 편이 좋습니다. 다만 README가 운영 SLA를 보장하는 것은 아니므로, 가중치 공개와 운영 안정성을 같은 의미로 받아들이기는 어렵습니다.

가중치 공개는 자체 호스팅 선택지를 열어 주지만, 운영 안정성까지 보증하는 것은 아닙니다.

또한 공개 이후에도 Exp 단계인 만큼, 프로덕션 기본 모델로 바로 고정하기보다 카나리나 오프라인 평가를 거쳐 교체 기준을 적어 두는 편이 현실적입니다. 라이선스 검토 전에는 파생 모델 배포 계획도 확정하지 않는 것이 좋습니다. MIT 문구는 저장소의 LICENSE를 직접 읽고 판단해야 합니다.

한 페이지로 정리하면

2026년 8월 31일 DeepSeek 공식 허깅페이스에 DeepSeek-V4-Flash-Vision-Exp가 MIT로 공개됐습니다. 주소는 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp입니다. 이 모델은 V4-Flash에 시각 모듈을 더한 실험 멀티모달 모델이며, image-text-to-text 태그와 함께 토크나이저, 인코딩 예제, 최소 추론 코드가 포함됩니다.

README에는 벤치마크 표와 Harness 설정, Opus-4.8 비교열이 있고, safetensors total은 304,646,824,126입니다. 다만 이 수치는 내부 평가이며, 영상·오디오까지 포함한 전 모달 발표나 독립 인증 벤치 결과로 읽을 수는 없습니다. 이번 공개의 의미는 실험 모델을 실제로 내려받아 확인할 수 있는 공식 가중치와 코드가 열렸다는 데 있습니다.

참고 자료

Hugging Face — deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

이 공개를 기준으로 보면, 여러분은 내부 평가 수치보다 가중치 공개 자체와 재현 경로 중 어느 쪽이 더 중요하다고 보시는지 궁금합니다.