9月10日,DeepSeek正式发布V4.1 Flash模型,这是其全新模型结构系列中的最小尺寸模型,具备原生多模态视觉理解能力。与此同时,DeepSeek Harness(DSH)发布v0.1.5版本,与V4.1 Flash模型训练深度结合,实现全面适配

模型架构与性能

V4.1 Flash为552B参数的MoE模型,采用全新的Causal-Encoder-Decoder非对称结构,输入激活仅8B,输出激活16B,成本显著低于同尺寸模型。在Agent使用场景中,新一代模型将KV Cache缓存大小压缩至上一代的1/4(HBM需求)和1/8(SSD需求),大幅降低了缓存命中费用占比较高的Agent类任务成本

基准测试显示,V4.1 Flash在多项指标上超越V4 Pro,包括Codeforces(3471 vs 3348)、Terminal-Bench 2.1(90.6 vs 87.9)和DeepSWE v1.1(74.2 vs 62.7)等

定价调整

V4.1 Flash的API价格于北京时间9月10日12:00起正式生效。空闲时段输入缓存命中单价降至每百万Token 0.02元,输入缓存未命中1元,输出4元;高峰时段价格为空闲时段的两倍。其中缓存命中输入价格降幅达60%

DSH 0.1.5适配更新

DSH v0.1.5与V4.1 Flash模型深度结合,模型针对标准模式、程序化工具调用(PTC)模式和极简模式进行了专项训练和优化。新版本支持在保留已有KV Cache的情况下更新系统提示词,进一步优化了推理效率

此外,DSH 0.1.5还新增了文件上传(支持图片、PDF等格式)和侧边栏文件预览功能,优化了长会话加载性能与内存占用,并增强了父Agent与子Agent之间的双向通信能力

旧模型下线安排

据官方通知,V4 Pro服务计划推迟至北京时间9月14日12:00下线。届时,所有指向V4 Pro的API请求将自动路由至V4.1 Flash,并按V4.1 Flash的单价计费

市场反应

首批开发者反馈显示,V4.1 Flash在速度方面的提升最为直观——有测试者称SVG代码生成速度较上一代快6倍,长上下文检索快5倍以上。不过也有开发者指出,复杂任务下的Token消耗有所增加,综合使用成本需根据具体场景评估。