Loading...

DeepSeek探索“智能密度”的极致实现

2026-09-09

DeepSeek给新版本Flash提出了挑战,试图将其Pro版替代。昨日,V4.1版本的Flash开始内测,其新模型结构、原生多模态和更快的速度成为了宣传的亮点。在附带的反馈问卷中,DeepSeek直接询问用户:“你认为这个模型能完全取代线上DeepSeek V4 Pro吗?”这一问题让人对DeepSeek的测试目标有了更深入的思考,究竟Flash能否在效果上超越Pro,成为更经济且适合大规模调用的选择。

Pro与Flash之间的价格差异显著,高峰时段Flash的每百万token收费9元,而Pro则为27元。最近,DeepSeek在其开放平台上宣布,将于9月10日调整Flash系列的价格:在空闲时段,每百万token的缓存命中输入将降至0.02元,未命中输入降至1元,输出降至4元,高峰价格则仍为空闲时段的两倍,降幅分别为60%、大约33%和约11%。新版本的Flash仍在测试能否替代Pro,而其使用门槛已经显著降低。开发者可以为了更好的结果偶尔支付三倍的价格,但在日常使用中,Flash的必要性得到了更多体现。

DeepSeek希望新版本能够集成Pro与Flash的优势:既要快又要强。自R1问世以来,AI的发展得到了更多人的关注,而DeepSeek现在面临的问题是如何使现有的推理能力得到更频繁的利用,推动“智能密度”的重要性。 龙8体育

在R1于2025年被广泛应用时,其诞生的魅力在于高水平的推理能力得以轻松获取。DeepSeek同时开放了模型权重,使普通用户能够通过“深度思考”应用使用R1,并且开发者可以借此蒸馏自己的模型。高质量推理不再是少数实验室的独有特权,而逐渐融入日常应用。

在2025年5月更新R1时,DeepSeek强调了“思考更深”的重要性。在AIME 2025测试中,新版R1的每题推理token消耗显著提高,从1.2万个增加至2.3万个,准确率也从70%提升至87.5%。虽然推理的时间消耗几乎翻倍,但只要结果值得,这样的等待是可以被接受的。

然而,在2025年12月发布的V3.2报告中,DeepSeek为自己设定了新目标:提升推理链的智能密度。为了达到Gemini 3.0 Pro等模型的输出质量,通常需要更长的推理过程。提高输出的等待时间显得尤为重要,差距不仅体现在速度上,还会影响费用。 龙8体育

在模型的应用中,小模型与大模型的分工显得尤其突出。V4早期模型指出,Flash在拥有更多推理预算的情况下,能达到接近Pro的表现,但在知识和复杂工作流上仍有差距。小模型的每一步计算成本较低,但往往需要更多的步骤才能实现大模型的效果。开发者所见的价格优势,最终能保留多少则取决于完成任务的方式。

因此,Flash若想取代Pro,必须同时提升能力和效率。更快的生成冗长推理能减少部分等待时间,较早发现有效的方法也能节约后续计算时间。对于频繁使用AI的用户来说,后者同样至关重要。

学术界也已开始将用户等待时间作为优化的一部分。EMNLP 2025的一项研究指出,最优计算方案不一定带来最低延迟,研究人员需要重新调整并行计算和推测解码,以在限定时间内获得更优秀的结果。DeepSeek也在提升生成速度。团队在7月发布的DSpark论文中报告称,在V4-Flash线上用户流量下,与MTP-1基线相比,单用户生成速度提升了60%到85%。团队专注于减少推测解码中的验证浪费,以便用户能够更快速地得到输出,同时兼顾服务的处理能力。 龙8体育

韩红自曝舞技背后惊人秘密,与刘德华的师徒情深
韩红自曝舞技背后惊人秘密,与刘德华的师徒情深

组织专为女性设计的足球比赛和训练营,推动女子足球的普及和发展。...

菲律宾防长在首尔论坛公开对中国挑衅
菲律宾防长在首尔论坛公开对中国挑衅

组织专为女性设计的足球比赛和训练营,推动女子足球的普及和发展。...