DeepSeek V4.1 Flash 정식 출시 — 멀티모달을 품은 플래시 모델이 V4-Pro 자리까지 맡습니다 | DAKER 커뮤니티

DeepSeek V4.1 Flash 설명용 생성 이미지

한 줄 답: DeepSeek는 2026년 9월 10일 V4.1-Flash를 API로 정식 출시했고, 2026년 9월 14일 13시(KST)부터는 deepseek-v4-pro로 보낸 요청도 V4.1-Flash가 Flash 요금으로 처리합니다. 공식 권장 호출 이름은 deepseek-flash입니다.

DeepSeek API를 쓰는 팀이라면 코드에 남은 모델 이름과 실제 청구 모델이 어긋나지 않는지 먼저 확인해야 합니다. 이 글은 DeepSeek 공식 공지 기준으로 라우팅 변경, 요금 주의점, 점검 순서를 정리합니다.

V4.1-Flash는 어떤 모델인가

V4.1-Flash는 DeepSeek 새 아키텍처 계열에서 가장 작은 모델입니다. 별도 비전 모델 없이 이미지를 직접 이해하는 네이티브 멀티모달이며, 인과적 인코더-디코더 구조를 씁니다. 공식 설명에 따르면 입력 쪽 약 80억, 출력 쪽 약 160억 파라미터가 활성화됩니다.

DeepSeek는 능력의 한계·추론 속도·처리량·더 큰 모델로 확장하기 쉬운 구조를 목표로 설계했다고 밝혔습니다. 앞으로는 deepseek-flash라는 이름으로 호출하라고 안내합니다.

코드에 V4-Pro를 그대로 적어 두었다면, 이미 다른 모델이 다른 요금으로 응답하고 있을 수 있습니다.

라우팅이 바뀐 일정

기존 V4-Flash와 V4-Flash-Vision-Exp는 서비스가 종료됐습니다. deepseek-v4-flash, deepseek-v4-flash-vision-exp로 호출하면 당분간 V4.1-Flash가 대신 응답합니다.

2026년 9월 14일 13시(한국 시간)부터는 deepseek-v4-pro로 보낸 요청도 V4.1-Flash가 처리하고, 요금도 Flash 기준으로 매깁니다. V4.1-Pro가 나올 때까지 이렇게 운영된다고 공식 공지는 설명합니다. DeepSeek가 V4-Pro를 내리는 이유로, 여러 테스트에서 V4.1-Flash가 성능·비용·속도·전체 실행 시간에서 V4-Pro보다 나았다고 적었습니다.

요금·호출 경로에서 볼 점

새 요금은 2026년 9월 10일 13시(KST)부터 적용됐고, 사용량이 적은 시간대에는 요금이 절반입니다. DeepSeek는 에이전트 작업에서 캐시 적중 비용 비중이 커질 수 있으니 캐시를 잘 쓰도록 프롬프트를 짜라고도 안내합니다. 구체 단가는 요금 페이지를 직접 확인해야 합니다.

DeepSeek API 외에 WorkBuddy(CodeBuddy 포함)·OpenCode가 V4.1-Flash를 지원한다고 안내되어 있습니다. Hugging Face 모델 카드와 기술 보고서도 함께 공개됐습니다. 총 파라미터 수처럼 공식 문서에 없는 수치는 이 글에 넣지 않았습니다.

팀 점검 3단계

1단계. 코드·대시보드에서 deepseek-v4-pro/deepseek-v4-flash를 찾아 deepseek-flash로 바꿉니다. 로그에는 호출 이름이 아니라 실제 응답 모델 이름을 남기면 비용·품질 추적이 쉽습니다.

2단계. 평소 프롬프트 다섯 건으로 지연·토큰·품질을 다시 잽니다. 이미지 입력이 있으면 텍스트·이미지를 한 엔드포인트로 합칠 수 있는지도 확인합니다.

3단계. 급하지 않은 대량 배치는 요금이 절반인 시간대로 옮깁니다. 위키에는 “기본 호출은 deepseek-flash, v4-pro 하드코딩 제거”를 한 줄로 적어 두면 됩니다.

숫자·일정만 다시 고정

공식 공지에서 옮겨 둘 타임스탬프는 세 개입니다. (1) 2026-09-10 V4.1-Flash API 정식 출시·새 요금 적용(KST 13시). (2) 2026-09-14 13시(KST)부터 deepseek-v4-pro 트래픽이 V4.1-Flash·Flash 요금으로 처리. (3) 권장 호출 이름 deepseek-flash. 활성 파라미터는 입력 약 80억·출력 약 160억이라고 공식 설명이 적습니다.

관측 로그에 남길 필드

호출명, 실제 응답 모델명, 입력·출력 토큰, 캐시 적중 여부, 지연(중앙값), 실패 사유 여섯 칸이면 충분합니다. 이름만 바꿔 두고 로그를 안 남기면, 9월 14일 이후 비용 변동을 “모델이 나빠졌다”로 오해하기 쉽습니다. 이미지 파이프라인이 있으면 텍스트-only와 멀티모달 요청을 태그로 분리하세요.

DAKER 참가자가 가져갈 한 줄 템플릿

팀 위키에 이렇게 적으세요. “기본 호출은 deepseek-flash다. deepseek-v4-pro 하드코딩은 제거하고, 2026-09-14 이후 트래픽이 Flash 요금·Flash 모델로 처리되는지 로그의 실제 응답 모델명으로 확인한다.”

멀티모달 파이프라인을 합칠 때

예전 V4-Flash-Vision-Exp 경로를 따로 두었다면, 이제 텍스트와 이미지를 한 Flash 엔드포인트로 합칠 수 있는지부터 확인합니다. 합치기 전후로 동일 프롬프트 세트에서 실패율·토큰·지연을 비교하고, 합칠 수 없는 전처리만 남기세요. 2차 보도의 총파라미터 추측은 로그에 넣지 않습니다.

마치며

V4.1-Flash는 작은 모델이 상위 모델 자리까지 맡게 된 드문 경우입니다. 성능·비용은 반가운 소식이지만, 이름만 믿고 코드를 두면 동작과 청구가 함께 바뀝니다. 여러분 팀 코드에는 아직 V4-Pro가 남아 있지 않나요?

출처