当前位置:首页 > Deepseek应用场景 > 正文内容

DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆

2个月前 (05-01)Deepseek应用场景163

IT之家 5 月 1 日消息,深度求索(DeepSeek)昨日(4 月 30 日)在 AI 开源社区 Hugging Face 上,发布名为 DeepSeek-Prover-V2-671B 的新模型,随后在 GitHub 等平台上公布了论文信息。

IT之家援引论文介绍,DeepSeek-Prover-V2 是一款专注于形式化数学推理的开源大型语言模型,基于 DeepSeek-V3-0324,通过递归定理证明管道生成初始数据。

Deepseek 推出了 DeepSeek-Prover-V2-671B(结合 V3 基础大模型)、DeepSeek-Prover-V2-7B(增强模型)两个模型,以及 DeepSeek-ProverBench 数据集。

DeepSeek-Prover-V2-671B 采用和 DeepSeek V3-0324 相同的架构,并非用于常规对话或者推理,而是用于形式化定理证明、专门增强数学能力的模型。

DeepSeek 团队首先引导 DeepSeek-V3 模型将复杂定理分解为一系列子目标(subgoals),整合非形式与形式化数学推理,在 Lean 4 平台上形式化证明步骤。

接着,利用一个较小的 7B 参数模型处理子目标的证明搜索,减轻计算负担。最终,结合完整的逐步证明与 DeepSeek-V3 的思维链(chain-of-thought),形成强化学习的“冷启动”数据。

在训练中,团队筛选出一批 7B 模型无法直接解决但子目标已被证明的难题。通过整合子目标证明,形成完整的形式化证明,并与 DeepSeek-V3 的推理过程对接,生成合成数据。

随后,模型微调这些数据,并通过强化学习进一步提升能力,以二元反馈(正确或错误)作为奖励机制。最终,DeepSeek-Prover-V2-671B 在神经定理证明领域创下新高,在 MiniF2F-test 数据集上通过率达 88.9%,在 PutnamBench 数据集中解决 658 个问题中的 49 个。

团队还发布了 ProverBench 基准数据集,包含 325 个形式化数学问题。其中,15 个问题源自近期 AIME 竞赛(AIME 24 和 25),涉及数论与代数,代表高中竞赛难度。

其余 310 个问题则来自精选教材和教学内容,涵盖线性代数、微积分、概率等多个领域。这一数据集旨在为高中竞赛和本科数学提供全面评估标准,推动模型在多样化场景下的测试与应用。

相关阅读:

《DeepSeek-Prover-V2-671B 新模型开源发布》


“DeepSeek-Prover-V2:AI 数学推理新王者,88.9% 通过率设新标杆” 的相关文章

“桥梁+DeepSeek”,上百种桥梁病害一键匹配!技术小白也能轻松使用

“桥梁+DeepSeek”,上百种桥梁病害一键匹配!技术小白也能轻松使用

DeepSeek爆火以来,大家有问题都习惯先问一问,但对特定领域的专业诉求时,其回答往往深度还有欠缺。3月12日,极目新闻记者从中铁大桥局桥科院获悉,其研发的人工智能“桥头堡·智能体”,用户使用这一软...

返利科技新增“DeepSeek概念”

返利科技新增“DeepSeek概念”

2025年4月24日,返利科技(600228)新增“DeepSeek概念”。据同花顺数据显示,入选理由是:2025年4月15日互动易,公司在线导购产品“返利”IOS版已接入DeepSeek(深度求索旗...

吉安:实现DeepSeek+政务服务三大场景创新应用

吉安:实现DeepSeek+政务服务三大场景创新应用

12345政务服务便民热线中心大江网/大江新闻客户端讯 记者周雪莉摄影报道:随着国产人工智能大模型DeepSeek的全球瞩目,各地加速推进“人工智能+政务服务”转型。近日,吉安市实现DeepSeek在...

DeepSeek有望助力全球南方国家跨越数字鸿沟

DeepSeek有望助力全球南方国家跨越数字鸿沟

“我认为DeepSeek有潜力帮助全球南方国家缩小数字鸿沟并加速现代化。”日前在南非举行的数字化转型峰会上,南非人工智能企业Matogen首席执行官雅各布斯·艾蒂安说。随着全球数字化进程加速,人工智能...

西部利得基金完成DeepSeek大模型本地化部署

西部利得基金完成DeepSeek大模型本地化部署

证券时报网讯,西部利得基金宣布,公司在数字化建设领域取得重要进展,完成了DeepSeek多个大模型的本地化部署,并搭建了公司内部AI应用平台。这一举措不仅标志着公司在智能化转型上的突破性进展,也为后续...

中创股份:公司已完成DeepSeek、通义千问等私有化大模型的部署工作

中创股份:公司已完成DeepSeek、通义千问等私有化大模型的部署工作

金融研究中心05月27日讯,有投资者向中创股份提问, 董秘您好!请问公司如何利用与华为等企业的深度合作关系,进一步提升公司中间件对AI应用场景的支撑能力,推动AI产业发展?  公司回答表示,尊敬的投资...