首页/AI 开源项目/DeepSeek-V4.1-Flash
开源大模型Hugging Face上手难度 🔧 进阶#大模型#MoE#Causal-Encoder-Decoder#非对称架构#多模态#MIT 许可#Hugging Face

DeepSeek-V4.1-Flash · DeepSeek V4.1 Flash 开源 MoE 模型

全新 Causal-Encoder-Decoder 架构,552B MoE 输入仅激活 8B,全面超越 V4 Pro,KV Cache 降至 1/4

指标同步中,请稍后刷新查看 在 Hugging Face 查看

5 分钟上手

API 使用无需硬件;自部署建议 8×A100 级集群
# Hugging Face 下载权重
huggingface-cli download deepseek-ai/DeepSeek-V4.1-Flash
# Ollama 运行
ollama run deepseek-v4.1-flash
# 或使用官方 API
curl https://api.deepseek.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -d '{"model": "deepseek-flash", "messages": [{"role": "user", "content": "你好"}]}'

项目速览

DeepSeek V4.1 Flash 是 DeepSeek 于 2026 年 9 月 10 日发布的全新架构开源 MoE 模型,定位「全新模型结构系列中最小尺寸的成员」,却在性能、速度、成本和总用时上全面超越自家旗舰 V4 Pro。它采用革命性的 Causal-Encoder-Decoder(CED)非对称架构,输入侧仅激活 8B 参数、输出侧激活 16B 参数,在保持 552B 总参数容量的同时大幅降低推理成本。原生支持多模态视觉理解,KV Cache 对 HBM 需求仅为上一代的 1/4、SSD 需求仅为 1/8。MIT 开源协议。

能做什么

  • 原生多模态视觉理解:直接接收图片,支持图文混合输入
  • 软件工程与 Agent 任务:DeepSWE v1.1 得 99.0% 逼近 Opus 5,Agent 场景成本仅为旗舰几分之一
  • 100 万 token 超长上下文,最大输出 384K tokens
  • 支持 Chat Completions / Responses API / Anthropic API 三种接口风格

怎么部署

Hugging Face 与 ModelScope 同步开放权重下载,MIT 许可证。配合 vLLM / SGLang 部署推理服务,或直接使用 DeepSeek 官方 API(模型名 deepseek-flash)。

适合谁

需要低成本高能力开源基座的开发者、Agent 工作负载密集的团队、关注模型架构创新的研究者。

✅ 优点

  • CED 非对称架构,输入/输出分离显著降低 Agent 推理成本
  • KV Cache 压缩至 1/4,长上下文场景性价比极高
  • MIT 许可开源,商用零合规压力

⚠️ 局限与坑

  • 总参数 552B,本地部署需要多卡集群
  • Terminal-Bench 等部分测试低于 Opus 5 等顶级闭源模型
  • CED 架构优势主要在 Agent 场景体现

💼 典型应用场景

  • 1.Agent 密集型任务的低成本推理底座
  • 2.多模态理解场景(图片+文本混合输入)
  • 3.软件工程自动化的开源基座模型

不想部署?试试同类在线工具

返回全部开源项目指标每周自动更新