2026年7月,一个名为dots的AI模型在国际数学奥林匹克(IMO)2026竞赛中斩获满分金牌。这一成就来自小红书旗下的大模型团队,标志着中国AI在高级数学推理领域实现了历史性突破。本文将从技术架构、训练方法和行业意义三个层面进行深度解析。
一、IMO 2026:AI数学推理的终极考场
国际数学奥林匹克(IMO)是全球最高水平的中学生数学竞赛,题目难度远超普通大学数学课程。人类选手需要在两天内完成6道题,每题满分7分,总分42分。传统AI模型在IMO题目上的得分长期徘徊在10-20分区间,而dots模型此次拿到了42分满分。
1.1 为什么IMO对AI如此困难?
- 创造性证明:IMO题目需要构造性证明,而非简单的数值计算
- 多步推理:一道题目通常需要10-50步逻辑推导
- 符号与几何混合:需要同时处理代数、几何、数论、组合四大领域
- 无固定解法:每道题都有多种证明路径,AI需要自主选择最优策略
二、dots模型的技术架构揭秘
虽然小红书尚未公布dots的完整技术论文,但从公开信息和业内分析可以勾勒出以下技术轮廓:
2.1 核心架构:多智能体协作推理
dots采用了多智能体协作(Multi-Agent Collaboration)架构,而非单一模型端到端生成:
class DotsProver:
def __init__(self):
self.planner = ReasoningAgent(model='dots-base-72b')
self.algebra_solver = MathAgent(domain='algebra')
self.geometry_solver = MathAgent(domain='geometry')
self.number_theory_solver = MathAgent(domain='number_theory')
self.combinatorics_solver = MathAgent(domain='combinatorics')
self.verifier = ProofVerifier()
def solve(self, problem):
plan = self.planner.analyze(problem)
if plan.domain == 'geometry':
draft = self.geometry_solver.attempt(problem, plan)
while not self.verifier.check(draft):
feedback = self.verifier.get_feedback(draft)
draft = self.planner.revise(draft, feedback)
return draft
2.2 训练数据与策略
业内推测dots的训练数据规模约500亿token,核心构成包括:
| 数据类型 | 占比 | 来源 |
|---|---|---|
| 形式化数学证明 | 35% | Lean 4库 + Mathlib |
| 竞赛题目与解答 | 25% | IMO、Putnam、CMO等 |
| 数学教材与论文 | 20% | 大学数学教材 + arXiv |
| 合成推理数据 | 15% | 自我对弈生成 |
| 自然语言数学讨论 | 5% | 数学论坛、博客 |
三、与Google DeepMind AlphaProof的对比
| 维度 | dots(小红书) | AlphaProof(DeepMind) |
|---|---|---|
| IMO 2026得分 | 42/42(金牌) | 未参赛(前版本28分) |
| 核心方法 | 多智能体+大模型 | 强化学习+形式化证明 |
| 证明形式 | 自然语言+形式化混合 | 纯形式化(Lean) |
| 训练算力 | 估计10^24 FLOPs | 估计10^25 FLOPs |
| 开源计划 | 未公布 | 部分开源 |
四、行业意义与深远影响
- 科学研究加速:数学证明AI可以辅助数学家探索猜想
- 算法设计革新:复杂算法的正确性验证将部分自动化
- 教育个性化:每个学生都能拥有IMO金牌水平的私人数学导师
- 竞赛生态变化:人类数学竞赛可能需要重新设计规则
结语:小红书dots模型在IMO 2026的满分夺金,是中国AI基础研究实力的有力证明。从dots的名字含义(’连接点成线’)来看,这个团队或许正在告诉我们:当足够多的技术点被连接,AI的推理能力将迎来质的飞跃。
原文链接:https://www.jikeyum.com/590.html,转载请注明出处。
评论0