搜索 猫眼电影 融媒体矩阵
  • 山东手机报

  • 猫眼电影

  • 大众网官方微信

  • 大众网官方微博

  • 抖音

  • 人民号

  • 全国党媒平台

  • 央视频

  • 百家号

  • 快手

  • 头条号

  • 哔哩哔哩

首页 >新闻 >社会新闻

DeepSeek发布最强开源新品,瞄向全能Agent,给GPT-5与Gemini 3下战书

2025-12-27 16:53:46
来源:

猫眼电影

作者:

仇乔石

手机查看

  猫眼电影记者 宋家镇 报道首次登录送91元红包

图片来源:unsplash

ChatGPT迎来三周岁生日之际,竞争对手DeepSeek送来了一份“生日礼”,似乎并不想让这位大模型领域的先行者过得那么轻松。

12月1日晚间,DeepSeek一口气发布了DeepSeek-V3.2和DeepSeek-V3.2-Speciale两个正式版模型,同步发布的技术论文显示,这两个推理能力达到了全球领先水平。

根据DeepSeek介绍,已经在网页端、App、API全部更新的“常规军”V3.2重在平衡推理能力与输出长度,适合日常使用。

在Benchmark推理测试中,V3.2与GPT5、Claude  4.5在不同领域各有高低,只有Gemini 3 Pro对比前三者均有较明显优势。

图片来自DeepSeek官微

与此同时,DeepSeek方面还表示,对比国产大模型厂商月之暗面新近发布的Kimi-K2-Thinking,V3.2的输出长度大幅降低,显著减少了计算开销与用户等待时间。在智能体评测中,V3.2得分也高于同为开源的Kimi-K2-Thinking和MiniMax M2,是目前的“最强开源大模型”,相比闭源大模型的巅峰也已无限迫近。

图片来自DeepSeek官微

更值得注意的是,V3.2在一些问答场景和通用Agent任务中的表现。在一个关于旅游攻略的具体场景咨询中,V3.2通过深度思考和网站爬虫、搜索引擎等工具调用,给出了十分详尽、精确的攻略和建议。V3.2更新的API首次支持了在思考模式下使用工具调用能力,大大提升了用户获取到的答案的丰富度和适用性。

而且,DeepSeek方面特别强调,V3.2“并没有针对这些测试集的工具进行特殊训练”。

我们注意到,在大模型测试得分越来越高,但在与普通用户的互动中却经常犯一些常识性错误的当下(尤其以GPT5发布时遭遇的吐槽为代表),DeepSeek近期“上新”时经常强调这一点,证明自身走的不是一条只用正确的答案作为奖励机制,打造出了看似高智商的“最强大脑”,却无法胜任用户个人所需的简单任务、简单问题的“低情商”智能体。

而只有从根本上克服这一点,成为所谓高智商、高情商的“双高”大模型,才有孕育出全能、可靠、高效的AI Agent的能力。DeepSeek方面也表示,相信V3.2在真实应用场景中能够展现出较强的泛化性。

为了在计算效率、强大推理能力与智能体性能之间取得平衡,DeepSeek在训练、整合以及应用层面进行了全方位的优化。根据技术论文,V3.2引入了DSA(DeepSeek稀疏注意力机制),能在长上下文场景中显著降低计算复杂度,同时保持模型性能。

同时,为了将推理能力整合到工具使用场景中,DeepSeek开发了新的合成流程,能够系统性地大规模生成训练数据。这一方法促进了可扩展的智能体训练后优化,显著提升了复杂、交互式环境中的泛化能力和对指令跟随能力。

另外,如上文所述,V3.2也是DeepSeek推出的首个将思考融入工具使用的模型,大幅提高了模型的泛化能力。

相比于重视平衡性,专注于如何“说人话、干人事”的V3.2,长思考“特种部队”V3.2 Speciale的定位则是将将开源模型的推理能力推向极致,探索模型能力的边界。

值得一提的是,V3.2 Speciale的一大亮点是结合了上周刚刚发布的最强数学大模型DeepSeek-Math-V2的定理证明能力。

我们此前的文章中提到,Math-V2不仅在2025国际数学奥林匹克竞赛和2024中国数学奥林匹克上都取得了金牌级成绩,在IMO-Proof Bench基准测试评估中还得到了比Gemini 3更好的成绩。

而且,与此前提到的思路类似,这款数学模型同样在努力克服正确答案奖励机制和“做题家”的身份,以自验证的方式突破目前AI在深度推理方面的局限,让大模型真的弄懂何为数学,怎样推导过程,以此形成更强大、稳定、实用也泛用的定理证明能力。

在推理能力上大幅增强的V3.2 Speciale,也在主流推理基准测试中取得了媲美Gemini 3.0 Pro的成绩。不过,V3.2 Speciale的能力优势需消耗大量Tokens,显著升高的成本让其目前不支持工具调用和日常对话、写作,仅供研究使用。

从OCR到Math-V2,再到V3.2和V3.2 Speciale,DeepSeek近期的新品发布不仅每次都收获赞誉一片,也在绝对能力提升的同时不断明确着“实用性”“泛化能力”等发展主线。

2025年后半程,GPT-5、Gemini 3、Claude Opus 4.5相继发布,测试成绩一次好过一次,再加上快速追赶的DeepSeek,“最牛大模型”的赛道已经有些拥挤。而头部的大模型在训练上已有较明显的区别,表现上也各有特色,相信2026年的大模型的竞赛会更加精彩。(作者|胡珈萌,编辑|李程程)

 时事1:美高梅游戏苹果手机版

  12月27日,柬内政部:柬泰边境冲突已致柬平民17死77伤,5月17日下午,国防部新闻局副局长、国防部新闻发言人张晓刚大校就近期涉军问题发布消息。,买球的一些app。

  12月27日,海军新闻发言人就辽宁舰航母编队远海训练发布消息,高校实力与经济水平不相匹配,曾一度是经济大省广东面临的尴尬处境。,网易世界杯足彩购买,kok体育,火狐体育手机版官方。

 时事2:彩神手机购彩大厅

  12月27日,专家谈《红楼梦》:其作者就是曹雪芹,今年1月1日,佛山市委办公室、佛山市政府办公室联合发布的“1号文件”透露,佛山将加快建设十大创新引领型特色制造业园区、十大现代服务业产业集聚区,重点培育发展机器人、新能源汽车等战略性新兴产业,推进家电、铝型材等优势传统产业链向价值链高端跃升。,凯时手机app下载,金博188网址,炸金花app下载官网。

  12月27日,管好用好政府债券 5000亿地方“补给”正在落地,当地时间2月8日,乌克兰总统泽连斯基出访英国,呼吁西方为乌军提供先进战斗机,此前英国方面已宣布将提供战斗机飞行员培训。泽连斯基随后还前往巴黎和布鲁塞尔先后会晤法、德以及欧盟领导人。,尊龙新版手机app,银河登录app,九游会ag登入。

 时事3:必赢体育APP下载

  12月27日,外交部:侵华日军731部队犯下罄竹难书的反人类罪行,铁证如山,不容否认,——在中俄总理定期会晤委员会机制框架下成立中俄北极航道合作分委会,开展北极开发和利用互利合作,保护北极地区生态系统,推动将北极航道打造成为重要的国际运输走廊,鼓励两国企业在提升北极航道运量和建设北极航道物流基础设施等方面加强合作。深化极地船舶技术和建造合作。,永利国际平台网站,九州体育登录网站,鸿博体育体育APP。

  12月27日,雄忻高铁阜平隧道顺利贯通,上交所方面,自2024年2月5日召开了上市委2024年第12次审议会议之后,第13次审议会议便迟迟未有安排。而对拟上市公司的申请受理,更新时间也停留在2023年12月31日。,通发娱乐,888国际真人娱乐网站,亚游AG网址。

 时事4:im体育在哪注册

  12月27日,第二十一届中国青少年发展论坛在中央团校举办,欧委会发布信息后,被抽样选中调查的三家车企中,上汽集团率先回应,“对欧委会的决定深感失望,相关措施不仅违背了市场经济原则和国际贸易规则,甚至可能对全球汽车产业链的稳定和中欧经贸合作产生较大不利影响。”企业殷切期望欧盟能够认真倾听中、德两国汽车企业的呼声,坚决避免人为设置新能源汽车贸易壁垒,切实维护公平竞争的市场环境。,168APP安卓,环亚旗舰厅在哪下载,贝博最新地址。

  12月27日,宠物医院主打“重症”治疗 小区业主忧心忡忡,即便如此,美国财政部长斯科特・贝森特近期在哥伦比亚广播公司新闻节目中预测,尽管遭遇停摆,“今年美国实际国内生产总值仍将实现 3% 的增长”。,皇冠轮盘网站,万博maxbextx手机版,盛兴线路手机版入口。

责编:杜希萌

审核:殷玮

责编:闫遂凌

相关推荐 换一换