DeepSeek新模型快到离谱,0.3秒思考还只卖白菜价
没有任何预告,DeepSeek V4.1 Flash的中间版本deepseek-v4.1-flash-expires-on-0910开始内测了。官方给出的信息很简短:采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。没有技术报告,也没有性能参数表,但这句话已经足够让人意外。 V4.1 Flash是DeepSeek第一款原生多模态模型。此前的V4 Flash Vision-Exp虽然也支持多模态,但属于“外挂式”——在V4 Flash 0731纯文本底座上,外接了一个视觉编码器和一个对齐器。V4.1 Flash则是出厂就自带图文一体化输入输出。更值得注意的是,V4正式版到V4.1只过了40天,就换上了新结构,还能在提高性能的同时降低成本。 实测速度:0.3秒思考,每秒420个token 就在招聘信息公布前后,这个内部代号为DeepSeek-v4.1-flash-expires-on-0910的中间测试版本突然开启测试,测试时间截止到9月10日。官方没有发布技术报告,但在《V4.1 Flash 中间版本邀测反馈问卷》中,有一道题很有意思:你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?选项分别是“可以”、“不可以”、“不确定”、“其他”。 能不能替代V4 Pro,得先看实际表现。测试下来,V4.1 Flash的速度实在太快了。以往跟大模型对话,即便响应再快,界面上往往也要跳动一两秒思考指示器。而在V4.1 Flash上,有开发者试探性地敲下一句“你好”,模型给出的思考时间只有0.3秒,生成速率瞬间飙到每秒159.3个token,整轮对话端到端耗时仅0.8秒。 在另一组重度长文本推理的实测截图中,模型生成速度甚至直接快到了每秒420个token,端到端吞吐达409.5token/秒。业内人的调侃是:“这吞吐量直接把别家所谓的极速模式做成了自己的日常基准”。 但这不只是“快”,更是“又快又准”。博主向阳乔木将一张西装照发给了DeepSeek V4.1 Flash,模型回答说他穿的是条纹西装。起初他以为又和V4 Flash Vision-Exp一样出现了幻觉,结果打开大图仔细一看,图中的人穿的就是条纹西装。 多任务对比:最快提升6倍 多位抢测的资深技术博主对V4.1 Flash与此前的V4 Flash Vision-Exp做了同任务端到端对比评测。结果显示: 在49k超长上下文检索场景下,新模型的处理速度快了5.2倍 在SVG代码生成上,快了6.0倍 在经典的Manacher回文算法题解答上,快了4.6倍 在大型SQL查询生成与优化上,快了5.0倍 在高难度的asyncio异步架构重构任务里,处理速度依然达到了前代的3.9倍 官方称V4.1 Flash采用新的结构、原生支持多模态,这话一点不假。还没完,在实现性能暴涨的同时,它的调用价格却和V4 Flash相同。社区中有很多关于梁文锋的梗,DeepSeek性能好价格低的时候将他尊称为“梁圣”、“梁祖”,涨价的时候又叫他“梁子”、“小梁”。到了V4.1 Flash这里,梁文锋又当回了梁圣。 150人扩招:从实验室到企业的成人礼 就在V4.1 Flash发布的前一天,DeepSeek突然宣布释放150人的大规模招聘名额,明确面向2至10年的资深工程师,同时也兼顾应届生与新锐人才。这次招聘主攻两个方向:其一是服务端开发工程师,涵盖大模型研究平台、Agent框架组件、研发效率基建、DeepSeek API、线上服务以及数据工程;其二是Agent弹性计算研发工程师,包含平台开发和维护、底层调优与攻坚。 作为DeepSeek Harness的负责人,崔添翼在社交平台发文称,这次扩招绝不是为了做常规业务堆人,而是因为“量的激增引发了复杂度的指数级爆炸”。他写道:“计算机领域的任何东西量变大之后,就会产生复杂度上巨大的增加。数据的量、机器/容器的量、训练任务的量、评测任务的量、Agent环境的量、用户的量、请求的量,等等等等,都在急剧增加。这就产生了越来越大的复杂度,会让之前的后端系统逐渐不能完美满足将来的量的需求,所以需要大量扩招人来升级、维护和重写各种后端系统。” 过去的大众认知里,DeepSeek是几十个天才算法科学家组成的“特种部队”,凭着极致的代码洁癖和作坊式的灵感创新,打出了让硅谷侧目的战绩。然而,当用户量、请求量和训练任务量同时撞上指数级曲线,单靠“精锐小队”已经不够用了。这次150人扩招,与其说是扩张,不如说是DeepSeek从实验室走向企业化运营的一次成人礼。 特别