DeepSeek又发重磅更新 后训练提升模型能力

作者:盛誉证券 发布时间:2026-08-03 00:05:57

DeepSeek又发重磅更新 后训练提升模型能力

后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”外汇配资综合信息门户,但目前仅在 API 端上线公测。此次更新只涉及 deepseek-v4-flash,V4-Pro API 以及 App 和网页端当前使用的模型并未随之更新。

DeepSeek又发重磅更新

值得注意的是,DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只是重新进行了后训练。这引发了人们的疑问:没有换架构,为什么能力还能提升?

老牌股票配资

DeepSeek又发重磅更新 后训练提升模型能力

大模型的训练可以简单分为两个阶段。首先是预训练,模型通过大量文本和代码学习知识,形成基础能力。其次是后训练,这是针对具体工作的专项训练,让模型学会如何回答问题、调用工具以及按要求完成任务。这次 DeepSeek 没有重新设计模型架构或扩大参数规模,而是在原有模型上重新进行后训练,导致内部权重和行为方式发生变化。

DeepSeek又发重磅更新 后训练提升模型能力

这种变化类似于同一辆车未更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布具体的后训练数据、奖励方法和训练流程,因此无法进一步断言性能提升究竟来自哪一种技术。

元股证券:ygzq.hk配资网上开户

新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。这些测试不同于传统代码补全,它们要求模型进入一个工作环境,读取文件、理解代码仓库、调用终端、修改程序、运行测试,并根据报错继续处理。这意味着模型不仅要知道答案,还要连续完成多个步骤。

然而,这些成绩不能完全归功于模型自身。部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位;DSBench-FullStack 和 DSBench-Hard 是 DeepSeek 的内部测试集。因此,更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,但在第三方框架中的实际表现仍需更多独立测试验证。

此次更新还包括 V4-Flash 原生支持 Responses API,并针对 Codex 进行了适配。Responses API 是一套更适合 Agent 的通信接口,能够更统一地处理模型回复、推理状态、工具调用和执行结果。它不会让模型突然变得更聪明,但可以减少模型接入 Codex 等 Agent 工具时的适配工作,使开发者更容易将模型集成到真实的软件开发流程中。

综上所述,这次更新包括重新后训练后的模型权重和更适合 Agent 使用的接口及运行环境。最终成绩由模型、推理预算、工具环境和 Agent 框架共同决定,难以单独归功于某一项。虽然 DeepSeek 提高了官方 Agent 基准成绩并增强了对 Responses API 和 Codex 工作流的支持,但现阶段还不能直接得出后训练已经可以替代模型扩容或者 V4-Flash 已经全面领先其他 Agent 模型的结论。

DeepSeek 正在验证一条更加务实的技术路线:当模型结构和参数规模保持不变时外汇配资综合信息门户,能否通过重新后训练、工具接口适配和 Agent 运行框架进一步提高模型完成真实任务的能力。尽管 DeepSeek 已给出官方成绩,但这条路线究竟能带来多大的实际提升,还需等待更多训练细节、公开工具和第三方测试。