DeepSeek又发重磅更新 后训练提升模型能力[看点] - 社会 - 国内资讯 - 亿席商务网
标王 热搜: 广州  SEO  贷款  深圳    医院  用户体验  网站建设  机器人  贵金属 
 
 
当前位置: 首页 » 资讯 » 国内资讯 » 社会 » 正文

DeepSeek又发重磅更新 后训练提升模型能力[看点]

放大字体  缩小字体 发布日期:2026-08-02 23:45:53  来源:互联网  作者:亿席商务网  浏览次数:62
核心提示:后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”,但目前仅在 API 端上线公测

后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”,但目前仅在 API 端上线公测。此次更新只涉及 deepseek-v4-flash,V4-Pro API 以及 App 和网页端当前使用的模型并未随之更新。

DeepSeek又发重磅更新

值得注意的是,DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只是重新进行了后训练。这引发了人们的疑问:没有换架构,为什么能力还能提升?

DeepSeek又发重磅更新 后训练提升模型能力

大模型的训练可以简单分为两个阶段。首先是预训练,模型通过大量文本和代码学习知识,形成基础能力。其次是后训练,这是针对具体工作的专项训练,让模型学会如何回答问题、调用工具以及按要求完成任务。这次 DeepSeek 没有重新设计模型架构或扩大参数规模,而是在原有模型上重新进行后训练,导致内部权重和行为方式发生变化。

DeepSeek又发重磅更新 后训练提升模型能力

这种变化类似于同一辆车未更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布具体的后训练数据、奖励方法和训练流程,因此无法进一步断言性能提升究竟来自哪一种技术。

新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。这些测试不同于传统代码补全,它们要求模型进入一个工作环境,读取文件、理解代码仓库、调用终端、修改程序、运行测试,并根据报错继续处理。这意味着模型不仅要知道答案,还要连续完成多个步骤。



 

  以上是“DeepSeek又发重磅更新 后训练提升模型能力[看点]”的全部内容,希望对大家有所帮助。


免责声明:以上所展示的信息由网友自行发布,内容的真实性、准确性和合法性由发布者负责。亿席商务网对此不承担任何直接责任及连带责任。任何单位或个人如对以上内容有权利主张(包括但不限于侵犯著作权、商业信誉等),请与我们联系并出示相关证据,我们将按国家相关法规即时移除。
 

[ 资讯搜索 ]  [ 加入收藏 ]  [ 告诉好友 ]  [ 打印本文 ]  [ 违规举报 ]  [ 关闭窗口 ]

 
 
本企业其他资讯

 
网站首页 | xml | top资讯 | 粤ICP备11090451号