Spark-X2.5-4B·1.7B 공개, 4B로 네이티브 100만 토큰 컨텍스트를 내세운 온디바이스 모델 | DAKER 커뮤니티

한 줄 답: 온디바이스에서 돌아가는 소형 모델 경쟁이 계속되는 가운데, 이번에는 词元星火(XHToken/SparkLLM)가 Spark-X2.5-4B·1.7B를 공개·오픈소스했습니다 관련 일정 예: ; 2026년 9월 1일.

데이콘·DAKER 커뮤니티 기준으로 정리한 안내입니다.

온디바이스에서 돌아가는 소형 모델 경쟁이 계속되는 가운데, 이번에는 词元星火(XHToken/SparkLLM)가 Spark-X2.5-4B·1.7B를 공개·오픈소스했습니다. 특히 눈에 띄는 지점은 네이티브 최대 100만 토큰 컨텍스트를 전면에 내세웠다는 점입니다.

가중치와 문서는 Hugging Face — Spark-X2.5-4B에서 확인할 수 있습니다. 국내 보도는 2026년 9월 1일 전후로 이 소식을 전했습니다. 오늘 글은 4B·1.7B 오픈웨이트 공개에만 초점을 맞춥니다.

단 4B로 백만 토큰을 읽습니다

이번 공개에서 확인할 수 있는 내용

Spark-X2.5는 4B와 1.7B 두 크기로 나왔습니다. 모델 카드는 이를 소형 범용 언어모델로 소개하며, 대화·작문·번역·추론·코딩·도구 호출·에이전트 워크플로를 지원한다고 적고 있습니다.

네이티브 컨텍스트는 최대 1M 토큰입니다.

모델 카드에는 Spark-X2.5 combines an efficiency-oriented architecture with native context windows of up to 1M tokens라고 적혀 있습니다. 온디바이스를 겨냥한 모델에서 백만 토큰을 전면에 내세운 점이 이번 발표의 핵심입니다.

언어 지원 범위도 넓게 제시됩니다. 모델 카드에는 support for more than 200 languages라는 문장이 있습니다. 다만 이 문장만으로 특정 언어의 실제 업무 적합성을 단정하기는 어렵고, 한국어 품질은 별도 평가가 필요합니다.

아키텍처 측면에서는 슬라이딩 윈도우와 풀 어텐션을 함께 쓰는 하이브리드 어텐션을 통해 효율을 노린다고 설명합니다. 장문맥에서 KV 캐시, 지연, 품질 사이의 균형을 맞추려는 접근으로 읽힙니다.

라이선스는 Apache 2.0입니다.

모델 카드에는 The Spark-X2.5 model series is licensed under the Apache 2.0 License라고 명시돼 있습니다.

배포 경로와 호환성

배포 경로는 비교적 넓게 안내됩니다. vLLM·SGLang·llama.cpp·MLX, Ollama·LM Studio, LLaMA-Factory 파인튜닝이 언급되며, NVIDIA·Huawei·Hygon·HOUMO.AI 등 하드웨어 호환도 적혀 있습니다.

GGUF 변환본도 별도 저장소로 제공됩니다. 관련 경로는 Spark-X2.5-4B-GGUF입니다. 다만 로컬 앱에서 쓸 때는 카드가 가리키는 llama.cpp 포크와 실제 사용 환경의 호환 여부를 먼저 확인하는 것이 좋습니다. 빌드가 다르면 로딩 오류가 날 수 있습니다.

단 4B로 백만 토큰을 읽습니다

읽을 때 구분해야 할 점

이번 소식은 Spark X2.5 계열 가운데 4B·1.7B 오픈웨이트 공개에 관한 내용입니다. DeepSeek 비전 가중치, GLM-5.3-Flash, HY4 미리보기와는 다른 이야기입니다.

또한 국내 보도에서 언급된 9월 7일 플래그십 Spark X2.5 예고는 어디까지나 예정으로 소개된 내용입니다. 이번 글에서 확정적으로 볼 수 있는 것은 4B·1.7B 공개와 모델 카드에 적힌 정보들입니다.

벤치마크 동급 최고, TTFT·TOPT 우위 같은 표현은 회사 주장으로 읽는 편이 안전합니다.

카드가 표로 숫자를 제시하지 않은 항목은 임의로 보강하지 않는 것이 좋습니다. 학습 코퍼스 규모처럼 중문 소개나 보도에서 따로 언급되는 수치가 있더라도, Hugging Face 영문 카드와 다르면 카드 문장을 우선해 보는 편이 안정적입니다.

단측 최초 같은 표현도 보도나 회사 소개의 맥락에서 이해할 필요가 있습니다. 독립 기관의 세계 최초 인증처럼 확대 해석하기보다, 모델 카드의 1M native context 문장을 기준으로 보는 편이 정확합니다.

로컬에서 볼 때 현실적으로 체크할 부분

이 모델은 온디바이스 시나리오를 강조하지만, 실제 사용에서는 메모리 한도를 먼저 봐야 합니다. 4B 모델이라도 1M 컨텍스트는 KV 캐시 부담이 크기 때문에, 장비에 맞춰 실제 창 길이를 낮춰 시험하는 것이 현실적입니다.

1M 컨텍스트는 가능 범위의 상한선으로 보고, 실제 운용 창 길이는 장비 한도에 맞춰 조정하는 편이 좋습니다.

모바일·PC·차량·가전처럼 단말 환경이 달라지면 메모리와 발열 한도도 달라집니다. 같은 4B라도 시나리오별로 감당 가능한 최대 창 길이가 다를 수 있습니다.

도구 호출과 에이전트 워크플로 지원도 소개되지만, 실제 연결은 허용 목록 기반으로 제한하는 편이 안전합니다. 단측 환경이라도 파일 접근 범위나 로그 저장 방식에 따라 보안 위험이 생길 수 있기 때문입니다.

파인튜닝은 LLaMA-Factory 경로가 언급되지만, 모델 라이선스와 별개로 데이터 라이선스와 산출물 정책은 따로 점검해야 합니다.

이번 발표가 아닌 것

이번 공개는 DeepSeek-V4 비전 MIT 재공지가 아닙니다. GLM-5.3-Flash 320B 재공지도 아닙니다. 9월 7일 플래그십 출시 완료 공지도 아니며, 클라우드 전용 초대형 모델 발표도 아닙니다. 성격은 단측·소형 오픈웨이트 공개에 가깝습니다.

한 페이지 요약

Spark-X2.5-4B·1.7B가 오픈소스로 공개됐고, 네이티브 최대 1M 토큰 컨텍스트와 200개 이상 언어 지원, Apache 2.0 라이선스를 내세웁니다. 배포 경로로는 vLLM·SGLang·llama.cpp·MLX·Ollama·LM Studio·LLaMA-Factory 등이 언급됩니다. 다만 실제 로컬 운용에서는 메모리와 KV 캐시 부담을 고려해 창 길이를 장비 한도에 맞춰 조정해 보는 것이 좋습니다.

출처