Research Notes(3) - MM-Agent:作为现实世界数学建模问题智能体的大语言模型
Jie Cao 炼丹师

MM-Agent:作为现实世界数学建模问题智能体的大语言模型

摘要

数学建模是科学发现与工程实践的基石,它能够将现实世界的问题转化为形式化系统,广泛应用于物理学、生物学和经济学等领域。与假定问题形式已经预先定义的数学推理不同,数学建模需要进行开放式的问题分析、抽象以及具有原则性的形式化。尽管大语言模型(Large Language Models,LLMs)已经展现出强大的推理能力,但它们在严谨的模型构建方面仍存在不足,这限制了其在现实世界问题求解中的实用性。为此,我们对由 LLM 驱动的现实世界数学建模任务进行了形式化定义;在该任务中,智能体必须分析问题、构建适合相应领域的形式化表示,并生成完整的端到端解决方案。

我们提出 MM-Bench,这是一个经过整理的基准测试集,包含来自美国大学生数学建模竞赛和交叉学科建模竞赛(MCM/ICM)的 111 个问题,覆盖 2000 年至 2025 年,涉及物理学、生物学和经济学等十个不同领域。为了处理这一任务,我们提出 MM-Agent,这是一种受专家工作流程启发的框架,将数学建模划分为四个阶段:开放式问题分析、结构化模型构建、计算问题求解和报告生成。

MM-Bench 上的实验表明,MM-Agent 显著优于基线智能体,其表现相较于人类专家解决方案提高了 11.88%;在使用 GPT-4o 时,每项任务仅需 15 分钟和 0.88 美元。此外,在遵循 MCM/ICM 官方规则的情况下,MM-Agent 协助两支本科生队伍在 2025 年 MCM/ICM 竞赛中获得 Finalist Award(在 27,456 支队伍中位列前 2.0%),证明了其作为数学建模副驾驶的实际有效性。

代码地址:https://github.com/usail-hkust/LLM-MM-Agent

演示地址:https://huggingface.co/spaces/MathematicalModelingAgent/MathematicalModelingAgent

1 引言

数学建模是表述、分析和解决复杂现实世界问题的一种基础性方法,它支撑着应用数学、自然科学、工程学和社会科学等领域的科学发现与技术进步。在实践中,这一过程通常从识别核心问题开始,随后将其抽象为数学形式,构建适当的模型,并求解这些模型以产生可付诸行动的见解。通过抽象、理论形式化、实证验证和迭代改进,数学建模能够将流行病控制、能源预测和供应链管理等不适定挑战转化为支持分析、预测和决策的数学系统 [1, 2]。

image
Figure 1:传统明确界定的数学问题与基于大语言模型(LLM)的开放式数学建模问题对比。左图:明确界定的数学问题,智能体通过解决该问题获得答案;右图:开放式数学建模问题,给定抽象的应用场景或现象后,智能体需先构建数学模型,再进行求解并提供完整的解决方案。

与从固定形式化描述出发的数学推理不同,数学建模要求进行开放式的问题抽象、假设设计以及以领域知识为基础的解释,因此具有情境敏感性,并且难以实现自动化,as shown in Figure 1。大语言模型近期的发展为该工作流程的部分自动化带来了新的机会,并在符号推理、科学问题求解和数值计算方面展现出潜力 [3, 4, 5]。开发基于 LLM 的建模智能体,有望为不同学科带来可扩展且高效的解决方案。然而,现有智能体往往无法掌握抽象、约束和假设等关键建模原则,从而产生过度简化且在科学上无效的输出。As shown in Table 1,它们经常遗漏关键假设,因而所构建的模型在现实世界中的有效性有限。

为弥补这一空白,我们正式定义了由 LLM 驱动的现实世界数学建模任务。该任务要求智能体将复杂的现实世界问题或现象转化为结构化且可执行的建模流程,并最终生成完整的分析报告。为了实现系统性评估,我们提出 MM-Bench,这是一个由 111 个现实世界问题构成的新基准测试集,这些问题改编自 2000 年至 2025 年的 MCM/ICM 竞赛。MM-Bench 涵盖十个应用领域,例如物理学、生物学和经济学,以及八种建模任务类型,例如决策、预测和评估。每个样本都包含丰富的上下文组成部分,例如文本描述、任务目标、数据集信息和变量定义,并要求智能体以集成的端到端方式完成问题解释、模型构建和数值推理。任务类型和领域分布的详细情况见 Appendix B

为处理这一任务,我们提出 MM-Agent,这是一种面向开放式现实世界建模问题的端到端解决方案。受专家工作流程启发,MM-Agent 能够系统地分析非结构化问题描述、构建结构化数学模型、推导解决方案并生成分析报告。在这些阶段中,建模步骤构成了最大的挑战,因为它要求将复杂情境抽象为数学上连贯的形式化表示,同时还必须以问题上下文和解决方案可行性为基础。

为此,我们提出分层数学建模库(Hierarchical Mathematical Modeling Library,HMML),它是一种包含领域、子领域和方法节点的三层知识层次结构。HMML 编码了 98 种高层建模模式,能够同时根据问题和解决方案检索建模策略,从而支持问题抽象和方法选择。具体而言,MM-Agent 首先分析问题并将其分解为多个子任务。随后,它从 HMML 中检索合适的方法,并通过 actor-critic 机制改进建模方案。为了求解模型,智能体使用 MLE-Solver 自主生成代码并对其进行迭代改进,从而实现高效、准确的执行。最后,它生成一份结构化报告,对建模方法、实验结果和关键见解进行总结。

我们的贡献可以概括如下:

  1. 我们开发了 MM-Bench,这是一个包含 111 个现实世界数学建模问题的基准测试集,覆盖 8 种问题类型和 10 个领域,用于评估 LLM 智能体的数学建模能力。该基准测试集基于现实世界竞赛进行了审慎构建。
  2. 为了增强 LLM 智能体的数学建模能力,我们构建了 HMML。该三层结构通过宽泛领域(例如优化、仿真)、具体子领域(例如线性规划、蒙特卡洛模拟)以及表示技术、核心思想和应用的方法节点来组织和检索建模方法,从而实现针对具体任务的精确检索。
  3. 我们提出 MM-Agent,这是一种自主智能体框架,用于为现实世界情境建立数学表示,以进行预测或提供见解。
  4. 我们在所提出的基准测试集上进行了全面实验,并证明 MM-Agent 能够有效解决数学建模任务,其性能优于基线方法。在 GPT-4o [6] 和 DeepSeek-R1 [7] 上,每项任务的平均成本分别为 0.88 美元和 0.56 美元,相较于人类专家解决方案提高了 11.88%。此外,在遵循 MCM/ICM 官方规则的情况下,MM-Agent 协助两支本科生队伍在 2025 年 MCM/ICM 竞赛中获得 Finalist Award,在 27,456 支队伍中位列前 2.0%。

2 相关工作

LLM 智能体

近期的进展推动了基于 LLM 的智能体的发展,这些智能体融合了结构化规划、推理和交互能力。通过利用记忆增强、反思式推理和工具使用等机制,这些智能体增强了任务分解、迭代改进和自适应问题求解能力 [8, 9, 10, 11, 12]。因此,基于 LLM 的智能体已经成功应用于软件工程 [13, 14, 15, 16]、游戏 [17, 18, 19, 20, 21, 22]、人类交互建模 [23, 24]、网络安全 [25, 26, 27]、机器人学 [28, 29, 30, 31, 32]、数据科学 [33, 34, 35, 36]、医学诊断 [37, 38, 39, 40]、Web 自动化 [41, 42, 43, 44] 和科学研究 [45, 46, 47, 48, 49] 等多个领域。

用于自主研究的 LLM

自动化科学工作流程使 LLM 能够集成到文献综述、创意生成、实验设计和科学写作等不同研究阶段中。一些研究关注通用研究任务 [48],另一些研究则探索人工智能 [45, 46, 50, 47]、生物医学发现 [51]、化学实验 [52] 和交通研究 [53] 等特定领域。

例如,Agent Laboratory [46] 是一种基于 LLM 的自主框架,旨在通过管理文献综述、实验和报告生成等关键阶段来加快人工智能研究。类似地,ORGANA [52] 是一种通过集成决策和感知工具实现化学实验自动化的机器人系统。它通过 LLM 与化学家协作,以确定研究目标并生成详细的实验日志。

用于数学的 LLM

通过精心整理的数据集和改进的推理策略,LLM 推动了数学问题求解的发展 [4]。数学基准测试集 [54, 55] 已经成为评估数学能力的重要资源,尤其是在与思维链(Chain-of-Thought,CoT)等提示技术结合使用时 [56]。在形式数学领域,LLM 已经在 MiniF2F [57] 等定理证明数据集上进行微调,并与 Lean [58] 和 Coq [59] 等证明助手相结合。程序辅助推理还允许模型生成并执行用于验证的代码,从而进一步增强了 LLM 的表现 [60]。

尽管 LLM 在具有明确符号目标、定义清晰的数学任务 [61, 62, 63, 64] 上表现良好,但数学建模仍然是一项开放式挑战:它要求将现实世界情境转化为形式化表示,而且通常不存在唯一正确的解决方案。据我们所知,MM-Agent 是首项探索将 LLM 应用于现实世界数学建模问题的工作。为了实现自主数学建模,我们开发了一套涵盖问题分析、数学建模、计算求解和解决方案报告的自动化流程。

3 为现实世界数学建模问题构建 LLM 智能体

第 3.1 节介绍现实世界数学建模任务,并说明 MM-Bench 的构建过程。MM-Bench 是首个旨在系统评估基于 LLM 的建模智能体处理开放式任务能力的基准测试集。为了进一步支持模型构建,我们还在第 3.2 节介绍分层数学建模库(HMML)。该建模库编码了一个涵盖领域、子领域和方法节点的三层知识层次结构,以促进结构化方法选择和问题抽象。第 3.3 节介绍 MM-Agent,这是一种受专家工作流程启发的框架,将建模过程分解为四个关键阶段:开放式问题分析、结构化模型构建、计算问题求解和报告生成。

3.1 MM-Bench

基准测试集构建

MCM/ICM 等现实世界数学建模竞赛要求世界各地的本科生将复杂的现实世界现象,例如风险管理和生物动力学,转化为用于预测、优化和决策的数学框架 [1, 2]。这些著名竞赛吸引了来自众多国家和地区的大量不同类型的参赛队伍 [65],要求参赛者通过协作来解释开放式问题、开展深入分析并提出完整的解决方案 [66]。因此,这些竞赛为评估 LLM 智能体在复杂现实情境中的问题求解能力提供了天然的基准。

我们收集了 2000 年至 2025 年举办的 MCM 和 ICM 竞赛中的全部赛题,其中既包括问题描述,也包括数据集等相关附件。随后,我们使用 GPT-4o 从竞赛题目中提取以下要素:描述问题上下文的背景信息、说明待完成任务的问题要求、指示数据集位置的数据集路径、提供数据集详细信息的数据集描述,以及解释数据集中各属性的变量描述。对于面向政策或以决策为重点的任务,可能不提供数据集,因为此类问题通常强调定性推理或基于情境的分析。

最后,我们对提取出的信息进行人工审查并纠正其中的错误,由此构建了名为 MM-Bench 的数学建模基准测试集。最终得到的 MM-Bench 包含 10 个领域、8 种任务类型,例如决策、预测和评估等,共计 111 个问题样本。详细统计信息见 Appendix B

任务形式

MM-Bench 评估智能体处理现实世界数学建模问题的表现。这些问题要求将现实世界现象转化为简化的数学形式,以分析、解释和预测系统的行为与结果。

给定一个数学问题 FF,智能体可以访问所有相关内容 fFf\in F,例如背景信息、问题要求、数据集路径、数据集描述和变量描述,并据此生成最终的解决方案报告。

评估

由于现实世界数学建模问题具有开放性,而且通常不存在标准解决方案,因此我们参考官方数学建模评估标准来评价智能体的表现 [66]。具体而言,我们从以下四个关键维度评估最终解决方案报告:

  1. 分析评价(Analysis Evaluation):考察问题定义是否清晰、是否识别出关键组成部分,以及各子任务与总体目标之间是否具有逻辑一致性。
  2. 建模严谨性(Modeling Rigorousness):重点考察严谨性与合理性,包括假设是否得到明确陈述和论证,以及所选方法、指标和模型结构能否准确、科学地表示现实世界问题。
  3. 实用性与科学性(Practicality and Scientificity):评估模型的实用性和科学有效性,确保模型能够实际应用、为决策提供有价值的见解,并遵循科学原则。该阶段还会验证模型在理论上是否可靠,以及是否考虑了所有相关科学因素,从而保证其有效性。
  4. 结果与偏差分析(Result and Bias Analysis):衡量结果的清晰度、可解释性和分析深度,重点关注对数据偏差或建模偏差的识别与缓解,以确保模型的稳健性和透明度。

我们同时采用基于 LLM 的评估和人类专家评估,以确保评价全面且可靠。更多细节见 Appendix D

3.2 分层数学建模库的构建

为了增强 LLM 智能体的数学建模能力,我们构建了分层数学建模库(Hierarchical Mathematical Modeling Library,HMML)。这是一个三层结构,通过宽泛领域(例如优化、仿真)、具体子领域(例如线性规划、蒙特卡洛模拟)以及表示技术、核心思想和应用的方法节点来组织和检索建模方法,从而实现针对具体任务的精确检索。

image
Figure 2: HMML 的结构分为三个层级:建模域、子域和方法节点。

Figure 2 所示,HMML 采用树形结构。在最高层,建模库由建模领域组成:

T={T(1),T(2),,T(n)}T=\{T^{(1)},T^{(2)},\cdots,T^{(n)}\}

每个建模领域 T(i)T^{(i)} 又被划分为多个子领域:

T(i)={T(i,1),T(i,2),,T(i,k)}T^{(i)}=\{T^{(i,1)},T^{(i,2)},\cdots,T^{(i,k)}\}

在每个子领域 T(i,j)T^{(i,j)} 中,具体的方法节点 N(i,j,l)N^{(i,j,l)} 被表示为元组:

N(i,j,l)={建模方法,核心思想,应用}N^{(i,j,l)}=\{\text{建模方法},\text{核心思想},\text{应用}\}

其中,“建模方法”提供高层概述,“核心思想”解释相应方法的基本原理,“应用”描述该方法的典型使用场景,例如资源分配和生产调度。

例如,在运筹学领域 T(1)T^{(1)} 中,规划理论子领域 T(1,1)T^{(1,1)} 包含方法节点 N(1,1,1)N^{(1,1,1)},该节点对应线性规划。其核心思想是在约束条件下优化线性目标,而其应用包括生产资源调度等问题。

HMML 包含运筹学、优化、机器学习、预测和评估等建模领域,共有 17 个子领域和大约 98 种建模方法,包括线性规划、蚁群优化、期望最大化、层次分析法和 Kolmogorov-Smirnov 检验等。更多细节见 Appendix C

3.3 MM-Agent

本节介绍 MM-Agent,这是一种基于 LLM 的多智能体系统,旨在实现数学建模任务的自动化。其工作流程由四个关键阶段组成:问题分析、数学建模、计算求解和解决方案报告。

MM-Agent 首先分析给定问题,并将其分解为多个子任务。随后,它为每个子任务构建形式化数学模型、开展实验并生成解决方案。最后,MM-Agent 生成一份总结解决方案和结果的完整报告。整体框架如 Figure 3 所示。

image
Figure 3:MM-Agent框架的整体架构如下:其工作流程包含四个连续阶段——问题分析、数学建模、计算求解及解决方案报告。在问题分析阶段,MM-Agent将输入问题分解为结构化的子任务;在数学建模阶段,它为每个子任务构建形式化的数学模型;在计算求解阶段,MM-Agent运用相应的计算方法推导出解决方案;最后在解决方案报告阶段,系统将所有结果整合成一份全面报告,清晰地总结各解决方案及相关见解。

3.3.1 问题分析

本节介绍 MM-Agent 的问题分析阶段,该阶段将复杂的现实世界问题转化为数学建模任务。这一过程包括抽象背景和要求等关键要素,并分析变量依赖关系等关联,以识别合适的建模方法。问题分析阶段由三个步骤组成:问题理解、问题分解和任务依赖分析。

问题理解

给定一个数学建模问题 FF,我们考虑一个 LLM:

y=πθ(x;xI)y=\pi_\theta(x;x_I)

其中,πθ()\pi_\theta(\cdot) 表示由 θ\theta 参数化的语言模型。该模型在指令提示 xIx_I 的引导下,根据输入序列 xx 自回归地生成输出 token yy。提示 xIx_I 编码与任务相关的上下文,例如背景信息、问题要求和数据集描述。

在该输入条件下,分析智能体执行结构化分析,以识别问题类型、核心概念、假设、目标和其他关键因素。具体而言,该过程表示为:

Up=πθ(F;xu)U_p=\pi_\theta(F;x_u)

其中,xux_u 表示用于问题理解的角色提示,UpU_p 是分析结果。为了加深对问题的理解,分析智能体采用自我反思机制,对其分析进行迭代改进。

问题分解

理解问题之后,协调智能体将问题分解为一组子任务,以处理问题包含的多个目标。该过程表示为:

D=πθ(F,Up;xd)D=\pi_\theta(F,U_p;x_d)

其中,xdx_d 表示用于问题分解的角色提示,D={D1,D2,,Dn}D=\{D_1,D_2,\cdots,D_n\} 表示子任务集合,每个 DiD_i 对应一个单独的子任务。每个子任务都与问题中的一个具体目标或组成部分相关联。

对于预测网球比赛中“势头”的问题,智能体将其分解为四个关键子任务:势头量化、区分势头与随机性、势头预测以及模型泛化。

任务依赖分析

由于各项任务并非相互独立,它们之间存在依赖关系。例如,一个模型预测任务可能依赖数据分析任务所产生的分析结果。为了捕获这些依赖关系并以最优方式满足问题要求,任务协调智能体首先进行全面分析,以识别任务之间的相互依赖关系。该过程表示为:

U=πθ(D;xt)U=\pi_\theta(D;x_t)

其中,U={u1,,un}U=\{u_1,\cdots,u_n\} 表示针对具体任务的依赖分析,uiu_i 表示对任务 DiD_i 的详细分析。指令提示 xtx_t 引导 LLM 分析任务之间的依赖关系。

随后,任务协调智能体进一步利用任务分析结果,构建顺序执行的子任务 {D1,D2,,Dn}\{D_1,D_2,\cdots,D_n\},其依赖图表示为:

G=(V,E)G=(V,E)

其中,V={D1,D2,,Dn}V=\{D_1,D_2,\cdots,D_n\} 表示节点集合,即任务集合;E={(Di,Dj)Di,DjV}E=\{(D_i,D_j)\mid D_i,D_j\in V\} 表示指示任务依赖关系的有向边。

顺序子任务依次执行,历史建模过程的结果存储在记忆模块中,表示为:

H={(D1,Q1),,(Dn,Qn)}H=\{(D_1,Q_1),\cdots,(D_n,Q_n)\}

其中,Qi={Mi,Ci,Oi}Q_i=\{M_i,C_i,O_i\} 表示子任务 DiD_i 的中间输出。具体来说,QiQ_i 包含数学建模方案 MiM_i、计算代码 CiC_i 和实验结果 OiO_i。协调智能体利用依赖图管理子任务之间的关系,并通过记忆模块促进任务之间的信息传递与通信。

3.3.2 数学建模

为了高效地实现数学建模问题求解的自动化,我们提出分层 Actor-Critic 建模优化方法。对于每个子任务 DiD_i,具体的数学建模过程首先从 HMML 中进行分层方法检索,随后通过 actor-critic 机制执行迭代优化。

分层建模知识检索

给定一个子任务 DiD_i 和一个分层建模库 TT,系统从根节点 T(i)T^{(i)} 开始执行深度优先搜索(Depth-First Search,DFS),以计算子任务与建模方法之间的相似度。相似度度量定义为:

Sim(D,N)=eDeNeDeN\operatorname{Sim}(D,N)=\frac{e_D\cdot e_N}{\|e_D\|\cdot\|e_N\|}

其中,eDe_DeNe_N 分别表示子任务 DD 与数学建模方法节点 NN 的嵌入表示。在实践中,我们采用嵌入模型 mGTE [67] 生成这些嵌入。

遍历完整的方法层次树之后,每个方法节点的最终得分通过结合其自身相似度和父节点相似度进行更新,计算方式为:

S(D,N)=ωSim(D,N)+(1ω)Sim(D,Nparent)S(D,N)=\omega\cdot\operatorname{Sim}(D,N)+(1-\omega)\cdot\operatorname{Sim}(D,N_{\mathrm{parent}})

其中,SS 表示评分函数,ω\omega 是超参数,NparentN_{\mathrm{parent}} 表示方法节点 NN 的父节点,即对应的子领域。

最后,选择并返回得分最高的 top-KK 个方法节点:

Ntop-K={N(1),,N(K)}N_{\mathrm{top\text{-}K}}=\{N^{(1)},\cdots,N^{(K)}\}

Actor-Critic 迭代建模优化

尽管检索得到的数学建模知识提供了基础方法和思想,但它通常缺少处理具体问题细节所需的深度,例如处理非线性约束、优化多个相互冲突的目标等。

为克服这些限制,我们提出 actor-critic 迭代优化框架。该框架逐步改进建模方案,使其能够有效处理复杂约束并提升解决方案的整体质量。

给定问题 DiD_i,任务协调智能体根据任务依赖图 GG,从记忆模块 HH 中检索相关的依赖资源 RiR_i。利用检索得到的资源 RiR_i 以及在检索步骤中获得的方法集合 Ntop-KN_{\mathrm{top\text{-}K}},actor 建模智能体生成初始建模方案:

Mi(0)=πθ(Di,Ntop-K,Ri;xa)M_i^{(0)}=\pi_\theta(D_i,N_{\mathrm{top\text{-}K}},R_i;x_a)

其中,xax_a 是建模提示。

随后,critic 智能体评估当前建模方案 Mi(t)M_i^{(t)} 的质量,并提供有针对性的反馈:

Fi(t)=πθ(Di,Mi(t),Ri;xc)F_i^{(t)}=\pi_\theta(D_i,M_i^{(t)},R_i;x_c)

其中,xcx_c 是 critic 反馈提示。

收到反馈 Fi(t)F_i^{(t)} 后,actor 建模智能体通过整合 critic 提出的建议和修正来改进方案:

Mi(t+1)=πθ(Mi(t),Fi(t);xr)M_i^{(t+1)}=\pi_\theta(M_i^{(t)},F_i^{(t)};x_r)

其中,xrx_r 是数学建模改进提示。该迭代过程持续进行,直至达到最大迭代次数 nrn_r

3.3.3 计算求解与解决方案报告

本节介绍 MM-Agent 的计算求解和解决方案报告阶段,重点是求解数学模型并生成完整的解决方案报告。智能体使用 MLE-Solver [68] 自主编写代码并开展计算实验。MLE-Solver 通过迭代生成、测试和改进代码,确保代码得到高效且准确的执行。

实验完成后,智能体生成结构化解决方案报告,对建模方法、实验结果和关键发现进行总结。

代码生成与执行

给定数学建模方案 MiM_i,建模编程智能体生成相应代码:

Ci=πθ(Di,Mi;xg)C_i=\pi_\theta(D_i,M_i;x_g)

其中,xgx_g 表示用于指导 LLM 生成计算代码的指令提示,CiC_i 表示任务 DiD_i 的数学建模代码。

代码生成后,程序将被编译,以检查是否存在运行时错误。如果编译成功,则返回实验结果 OiO_i。如果代码编译失败,智能体会分析最近一次错误消息并进行必要修正,最多尝试修复 ncn_c 轮。

任务完成后,任务协调智能体更新其记忆:

HH{Di,Qi}H\leftarrow H\cup\{D_i,Q_i\}

在实践中,对于与政策相关的建模问题,其目标是基于现有知识或模型提供见解与建议,因此建模智能体会直接给出这些见解,而不生成代码。

初步报告大纲

所有任务完成后,报告智能体汇总整个问题求解过程。第一步是为数学建模报告构建结构化大纲。该大纲确定报告框架,并将其组织为八个关键部分:摘要、问题重述、模型假设、假设的合理性论证、符号与定义、问题分析、解决方案和结论。

为了确保清晰性和连贯性,该大纲采用适当的 LaTeX 格式,以便顺利编译和进一步改进。通过系统地组织内容,大纲为形成深入且结构良好的最终报告奠定了坚实基础。

解决方案报告

大纲确定后,报告智能体利用专门的命令,并根据任务协调智能体的记忆 HH 逐步改进报告。在合并任何修订之前,系统都会编译 LaTeX 代码,以确保其能够正常运行,从而保持文档的完整性。通过一系列迭代编辑,智能体确保报告达到所需的质量、连贯性和学术严谨性标准。

4 实验

4.1 实验设置

基线

我们将 MM-Agent 与人类编写的解决方案和当前最先进的 LLM 智能体进行比较。由于此前没有工作直接针对数学建模问题,因此我们调整了现有自主研究智能体的用途,以进行对比。基线包括:

  1. 人类团队(Human Team):来自现实世界数学建模竞赛的获奖解决方案,获奖级别为 Honorable Mention 或更高,作为强有力的人类基准。
  2. DS-Agent [33]:一种用于自动化数据科学的 LLM 智能体。我们调整其基于案例推理的核心框架,使其适用于数学建模任务。
  3. ResearchAgent [50]:最初旨在为机器学习任务实现实验循环自动化。我们调整其核心框架,使其适用于数学建模问题。
  4. Agent Laboratory [46]:一种科学发现框架,通过文献综述、实验和报告撰写引导智能体。我们对其进行了扩展,使其可以在 arXiv 中搜索相关建模方法,并将这些方法组合为问题求解流程。

实验实现

我们从过去五年,即 2021—2025 年的数学建模问题中选取一个子集作为测试集,并确保问题类型和领域具有多样性,从而支持具有代表性的评估。该子集总计包含 32 个问题。

为了减轻 LLM 预训练可能导致的数据泄漏,我们将 2021—2024 年的问题与 2025 年的问题分开评估。评估中使用的 LLM 智能体以 GPT-4o 和 DeepSeek-R1 作为基础模型。

在评估中,我们同时采用基于 GPT-4o 的自动评分和人类专家审查,并统一使用 1 至 10 分的评分尺度。所选人类专家此前均至少在数学建模竞赛中获得过 Honorable Mention。其他实验细节见 Appendix D。为了评估标注质量,我们测量了标注者之间的一致性,包括人类—人类一致性和模型—人类一致性,具体见 Appendix E.4

4.2 实验结果

主要实验

image
Table 1: Experimental results on the 2021–2024 and 2025 mathematical modeling competitions. AE, MR, PS, and RBA denote Analysis Evaluation, Modeling Rigorousness, Practicality and Scientificity, and Result and Bias Analysis, respectively.

Table 1 表明,MM-Agent 在所有评估维度上均取得了当前最先进的表现。

首先,在不进行智能体级组织的情况下直接应用基础模型 GPT-4o 或 DeepSeek-R1-671B,其表现明显较弱,尤其是在建模严谨性以及结果与偏差分析方面。这一差距表明,LLM 无法充分处理现实世界建模任务所要求的开放式、结构化推理,并凸显了结构化智能体工作流程的必要性。

其次,无论使用 GPT-4o 还是 DeepSeek-R1-671B 作为骨干模型,MM-Agent 始终优于所有基线智能体,并取得最高的总体评分。

第三,基于 DeepSeek-R1-671B 构建的智能体优于其 GPT-4o 对应版本。MM-Agent 在建模严谨性以及结果与偏差分析方面表现出显著提升,这表明更大的模型具有更强的推理能力。

第四,人类团队仍然是强有力的竞争者。除 MM-Agent 外,人类团队在大多数指标上均优于所有基于 LLM 的智能体。这既说明了该任务的复杂性,也表明 MM-Agent 已经具备接近人类水平的建模能力。

第五,2025 年的结果与 2021—2024 年的结果高度一致,表明该方法具有很强的时间一致性。这种稳健性缓解了人们对潜在数据泄漏,例如模型记忆已有解决方案的担忧,并进一步支持以下结论:MM-Agent 执行的是真正的建模,而不是对已有数据进行过拟合。

除基准测试结果外,我们还基于 MM-Agent 开发了一套公开可用的建模辅助系统,该系统符合 MCM/ICM 官方规则和 LLM 使用指南。该系统协助两支本科生队伍在 2025 年 MCM/ICM 竞赛中获得 Finalist Award,在 27,456 支队伍中位列前 2.0%。这一现实世界验证说明,MM-Agent 作为建模副驾驶具有实际有效性,能够在高风险、开放式科学任务中为人类用户提供支持。

4.3 消融研究与进一步分析

为了更好地理解 MM-Agent 的设计及实际效用,我们开展了三个方面的分析。首先,我们进行消融研究,以量化各个核心模块对建模表现的影响。其次,我们评估 token 使用量、成本和运行时间,以考察其部署效率。最后,我们在定义明确、已经完成形式化的问题上测试 MM-Agent,以考察其在开放式建模之外的泛化能力。

关键组成部分的贡献

我们开展消融研究,以评估 MM-Agent 中三个核心模块的影响:任务依赖分析(Dependency Analysis,DA)、分层数学建模库(HMML)以及分层 Actor-Critic 建模(Hierarchical Actor-Critic Modeling,HACM)。

具体而言,我们采用以下三种变体:

  1. 使用朴素任务解析器替代 DA,即不使用 DA;
  2. 使用缺少层次结构的扁平检索库替代 HMML,即不使用 HMML;
  3. 移除 HACM,从而禁用迭代式自我改进,即不使用 HACM。

这些变体使我们能够评估各个模块对结构化问题理解和建模表现的贡献。

image
Figure 4:问题分析与数学建模效果的消融研究。

Figure 4 所示,在 GPT-4o 和 DeepSeek-R1-671B 两种骨干模型上,MM-Agent 在四项评估指标下始终优于所有消融变体。移除 DA 会显著降低建模严谨性,这表明深入的任务理解对于严谨的形式化至关重要。缺少 HACM 会导致分析评价以及实用性与科学性明显下降,凸显出该模块在构建连贯、科学合理的模型方面具有关键作用。

值得注意的是,移除 HMML 会导致分析评价以及结果与偏差分析明显下降,这突出说明结构化检索对于使建模策略同时与问题上下文和解决方案需求保持一致非常重要。扁平建模库以相同方式处理所有方法,而 HMML 则编码了 98 种高层建模模式,并按照问题类型、抽象层级和解决方案范式对其进行分层组织。这使系统可以执行同时面向问题和面向解决方案的检索,从而更好地支持抽象、约束推理和方法选择;这些都是有效建模的关键能力。

成本效率分析

我们评估了 MM-Agent 求解现实世界数学建模问题的成本效率,重点考察 token 使用量、货币成本和运行时间。所有评估均通过模型供应商提供的官方 API 完成。

image
Table 2:关于平均 token 消耗量、成本及运行时间的实验结果。

Table 2 所示,MM-Agent 的计算成本和运行时间与 DS-Agent、ResearchAgent 相当,同时取得了与之相当或更好的表现。与 Agent Laboratory 相比,MM-Agent 在取得更高性能的同时,显著降低了成本和执行时间,这凸显了其可扩展性和实际可行性。有关其他模型的进一步结果和详细案例研究见 Appendix E

定义明确的数学优化问题实验

为了补充 MM-Bench 对开放式问题的关注,我们还在定义明确的数学优化任务上评估 MM-Agent,其中包括线性规划和非线性规划。

在该设置中,智能体接收完整的问题说明,例如变量、目标函数和约束条件,并直接输出数值解。由于这些任务具有已知的真实答案,因此可以直接使用准确率作为性能指标。

我们在 OPTIBENCH 数据集 [4] 上进行实验,详细结果见 Table 5Appendix E.2)。MM-Agent 在零样本设置下的所有子任务中始终优于 GPT-4o,表明它能够稳健地泛化到已经完成形式化的优化问题。

5 结论

在本研究中,我们提出 MM-Bench,这是一个用于评估基于 LLM 的智能体处理现实世界数学建模任务能力的基准测试集。通过评估智能体在不同领域和问题上的表现,我们揭示了在连接现实世界现象与数学形式化表示时面临的关键挑战。

我们的研究结果表明,现有 LLM 智能体经常忽视抽象、约束和假设等基本建模原则,从而产生过度简化且在科学上无效的输出。为解决这些问题,我们提出 MM-Agent,这是一套能够系统地处理问题分析、模型构建、解决方案开发和结果解释的自主流程。

全面的实验表明,MM-Agent 显著优于现有 LLM 智能体,但在高阶推理和跨学科问题求解方面仍然存在挑战。我们希望,本文提出的基准测试集和框架能够为未来由 LLM 驱动的数学建模研究奠定基础。

【Supplementary Material】MM-Agent: LLM as Agents for Real-world Mathematical Modeling Problem

A 更广泛的影响

数学建模是表述、分析和解决复杂现实世界问题的基石性方法,为应用数学、自然科学、工程学和社会科学中的科学发现与技术进步提供了支撑。通过实现这一过程的自动化,我们关于由 LLM 驱动的数学建模智能体(MM-Agent)的研究,有望显著扩大高质量建模专业知识的可获得性,加快数据稀缺或专家资源有限领域的研究,并为流行病学、可持续发展和基础设施规划等高风险环境中的决策提供支持。

MM-Agent 降低了将数学建模应用于各种现实世界问题的门槛。MM-Agent 使学生、从业者或政策制定者等非专业人士能够通过结构化分析推理探索复杂系统,从而推动建模过程的普及。这可以显著促进 STEM 教育、跨学科协作,以及灾害管理或城市系统等时间敏感领域中的快速响应。此外,通过编码专家级工作流程和结构化领域知识,MM-Agent 为不同领域中可扩展且可复用的建模提供了基础,并可能促进建模资源有限领域中的科学发现。

污染与抄袭

由于我们的数据集包含公开可用的数学建模竞赛题目,LLM 可能已经接触过相应的解决方案报告,例如来自 arXiv 等网站的报告。这引入了潜在的数据污染风险,即模型可能记忆解决方案或从中获得启发,从而使其在 MM-Bench 上的表现被人为提升,超出其实际能力。为了减轻这一风险,我们选择了最近一年,即 2025 年的竞赛问题,以确保接受评估的 LLM 没有使用这些特定解决方案进行训练。我们的实验(第 4.2 节)未在 GPT-4o 或 DeepSeek-R1 中发现系统性的数据污染效应。此外,2025 年竞赛结果的分布与往年结果保持一致。尽管如此,我们无法保证未来的模型仍然不受数据污染的影响。为了主动管理潜在的数据污染风险,我们建议定期使用新的数学建模问题更新 MM-Bench。

评判偏差与可访问性

尽管我们使用标注者间一致性指标来评估标注质量,但人类标注者和 LLM 标注者中仍然存在偏差,这尤其是因为对不同建模解决方案的评价在本质上具有主观性。在未来的工作中,我们计划开发一个数学建模评判模型,以提供更加结构化、透明且一致的评估,从而减少标注者偏差。此外,在 MM-Bench 上运行 LLM 智能体需要较高的计算成本。在我们的实验中,GPT-4o 和 DeepSeek-R1 分别消耗了大约 53 万和 24 万个 token。

滥用

MM-Agent 为简化工程优化、环境资源管理和流行病预测等不同领域中的现实世界数学建模任务提供了重要机遇。通过自动化复杂且劳动密集型的过程,该技术使研究人员能够更加有效地专注于概念创新和实验设计。然而,该智能体强大的自动化能力也带来了重大的伦理问题。使用门槛的降低可能会在无意中促进低质量或具有误导性的科学成果生成。此外,完全由人工智能生成的报告可能会在数学建模竞赛中遭到滥用。为了应对这些伦理挑战并维护学术诚信,必须透明地披露竞赛提交内容中使用的任何人工智能辅助。

B MM-Bench 的统计信息

MM-Bench 包含 10 个领域、8 种任务类型,例如决策、预测和评估等,共计 111 个问题样本,所有样本均来自面向本科生的数学建模竞赛(MCM 和 ICM)。MM-Bench 中的每个样本都基于一道数学建模竞赛题目,并包含以下内容:描述问题情境的背景信息、概述待完成任务的问题要求、指示数据集所在位置的数据集路径、提供数据集详细信息的数据集描述,以及解释数据集中各项属性的变量描述。对于面向政策或以决策为重点的任务,可能不会提供数据集,因为这些问题通常强调定性推理或基于情境的分析。统计信息详见 Figure 5

image

C 分层数学建模库的构建

为了增强 LLM 智能体的数学建模能力,我们提出分层数学建模库(Hierarchical Mathematical Modeling Library,HMML)。HMML 是一种三级结构化层次体系,旨在高效且有针对性地检索方法。与传统的扁平建模库不同,HMML 通过将方法划分为不同的建模领域(顶层)、相关子领域(中间层)和具体方法节点(底层),明确地捕获方法之间的异质性。这一结构化设计采用专门针对数学建模任务定制的高层推理模式,通过逐步细化的搜索简化检索过程。

具体而言,HMML 采用由三个抽象层级组成的树形结构。顶层表示不同的数学建模领域,第二层对应各领域的子领域,第三层包含具体的方法节点。形式上,HMML 的层次结构表示如下:在最高层,数学建模领域表示为

T={T(1),T(2),,T(n)}T=\{T^{(1)},T^{(2)},\cdots,T^{(n)}\}

每个建模领域子树 T(i)T^{(i)} 进一步划分为多个子领域:

T(i)={T(i,1),T(i,2),,T(i,k)}T^{(i)}=\{T^{(i,1)},T^{(i,2)},\cdots,T^{(i,k)}\}

在每个子领域 T(i,j)T^{(i,j)} 中,具体的方法节点 N(i,j,l)N^{(i,j,l)} 被明确组织为元组:

N(i,j,l)={建模方法,核心思想,应用}N^{(i,j,l)}=\{\text{建模方法},\text{核心思想},\text{应用}\}

其中,“建模方法”提供对数学建模方法的高层介绍,“核心思想”描述支撑该建模方法的基本原理,“应用”说明典型情境并界定其应用范围,例如资源分配优化和生产调度。

例如,在运筹学领域中,T(1)=运筹学T^{(1)}=\text{运筹学},规划理论子领域 T(1,1)=规划理论T^{(1,1)}=\text{规划理论} 包含具体的方法节点 N(1,1,1)N^{(1,1,1)}。该节点涉及线性规划建模方法,其核心思想是使用线性目标和约束进行优化,其应用包括生产资源调度。

最终的数学建模库包含五个领域,例如运筹学、优化、机器学习、预测和评估;包含 17 个子领域,例如规划理论、图论、聚类和统计学等;并涵盖大约 98 种建模方法,例如线性规划、蚁群优化、期望最大化、层次分析法和 Kolmogorov-Smirnov 检验。

D 实验设置

评估

由于现实世界中的数学建模问题具有开放性且缺少标准答案,因此我们遵循官方数学建模评估标准,对最终解决方案报告进行评价。我们从以下四个关键方面评估智能体的数学建模能力:

  1. 分析评价(Analysis Evaluation):评估问题定义的清晰度、关键组成部分的识别情况,以及各子任务相对于总体目标的一致性。

  2. 建模严谨性(Modeling Rigorousness):重点考察严谨性和合理性,评估假设是否得到明确陈述和论证,以及所选方法、指标和模型结构是否能够准确且科学地表示现实世界问题。

  3. 实用性与科学性(Practicality and Scientificity):评估模型的实用性和科学有效性,确保模型能够现实地应用、能够为决策提供有价值的见解,并且符合科学原则。该阶段还会验证模型在理论上是否可靠,以及是否考虑了所有相关科学因素,从而确保其有效性。

  4. 结果与偏差分析(Result and Bias Analysis):评估结果及其分析的清晰度、可解释性和完整程度。此外,该指标还评估模型在识别、分析和缓解数据偏差、模型偏差等潜在偏差方面的表现,以提高模型的稳健性并明确其局限性。

基线

我们将 MM-Agent 与人类团队的竞赛解决方案和现有的基于 LLM 的智能体进行比较。由于此前没有专门研究数学建模问题的工作,因此我们采用为自主研究而设计的其他 LLM 智能体来处理这些问题。具体而言,我们的基线包括:

  1. 人类团队(Human Team):使用现实世界数学建模竞赛中的原始解决方案,所选团队至少获得了 Honorable Mention。这些获奖解决方案被用作基准参考。

  2. LLM:直接使用一个 LLM 生成数学建模解决方案。

  3. DS-Agent:一种专门用于自动执行数据科学任务的 LLM 智能体。我们调整其基于案例推理的核心设计,以处理数学建模问题。

  4. ResearchAgent:一种旨在自动执行研究工作流程和生成研究创意的 LLM 智能体。我们将其与一个机器学习智能体集成,以增强其数学建模能力。

  5. Agent Laboratory:一种基于 LLM 的框架,旨在通过文献综述、实验和报告撰写等阶段引导研究过程,从而加速科学发现。对于 Agent Laboratory,智能体会在 arXiv 中搜索相关论文,以识别数学建模方法,随后使用这些方法构建解决建模问题的流程。

E 其他实验

E.1 在其他模型上的实验

实验结果表明,在以 Qwen2.5-72B 为基础模型处理 2021—2025 年数学建模竞赛问题时,MM-Agent 在所有评估指标上始终优于基线智能体 DS-Agent 和 ResearchAgent。由于 Qwen2.5-72B 的能力弱于 GPT-4o 和 DeepSeek-R1-671B,Agent Laboratory 的工作流程无法高效运行。

MM-Agent 取得了最高的总体评分 8.37,并在分析评价(8.61)、建模严谨性(7.59)以及实用性与科学性(8.89)方面表现突出,反映出其在以科学严谨性和现实相关性处理复杂问题方面具有更强的能力。MM-Agent 在不同竞赛年份中的稳定表现进一步证明了其方法的稳健性,表明其成功并非过拟合所致,而是源自其有效的建模能力。

E.2 定义明确的数学优化问题实验

为了进一步评估 MM-Agent 的能力,我们将实验扩展到定义明确的数学优化问题,包括线性规划和非线性规划。在该设置中,智能体会获得变量、目标函数和约束条件,并被要求通过直接给出数值解来求解优化问题。由于这些问题具有定义明确的真实解,因此可以直接使用准确率作为评价 MM-Agent 性能的指标。

具体而言,我们在广泛使用的 OPTIBENCH 数据集 [4] 上开展实验。由于这些优化问题不需要进行任务分解,我们适当地修改了智能体配置,使其与该任务的结构相匹配。

结果表明,在零样本设置下,MM-Agent 在所有子任务中均始终优于 GPT-4o。在线性规划中,MM-Agent 在不使用表格输入时取得了 79.5% 的准确率,在使用表格支持时取得了 70.0% 的准确率,分别比 GPT-4o 高出 2.0% 和 1.2%。在非线性优化中也观察到类似趋势:MM-Agent 在不使用表格和使用表格时,分别将性能提高了 2.3% 和 2.0%。

值得注意的是,MM-Agent 还取得了更高的总体准确率(68.8%)和代码通过率(99.3%),表明其具有更好的稳健性和代码可靠性。这些结果突出了 MM-Agent 在求解结构清晰的数学任务时所表现出的更强推理能力和稳健性。

E.3 人类评估结果

由人类专家进行评价的实验结果表明,我们在四个关键维度上报告了平均得分:分析评价(Analysis Evaluation,AE)、建模严谨性(Modeling Rigorousness,MR)、实用性与科学性(Practicality and Scientificity,PS),以及结果与偏差分析(Result and Bias Analysis,RBA)。

MM-Agent 在所有维度上始终取得最高性能,尤其在 AE 和 RBA 方面表现突出。DS-Agent 和 Agent Laboratory 在 AE 和 PS 方面表现相近,但前者在 RBA 方面略占优势。值得注意的是,ResearchAgent 在 PS 方面具有竞争力,但在 MR 和 RBA 方面表现落后,表明其建模严谨性和偏差意识较弱。

这些结果证明,在专家评估下,MM-Agent 具有更优的总体性能和稳健性,尤其能够生成分析充分且偏差较小的建模输出。

注:由于对 LLM 指令遵循能力的要求较高,Agent Laboratory 的执行失败。

E.4 标注质量

为了评估标注质量,我们在 MM-2025 数据集上测量了标注者间一致性。我们首先对每位人类标注者和 LLM 标注者给出的分数进行排序,随后计算每一对标注者的排序分数之间的 Pearson 相关系数。

人类—人类一致性

两位人类标注者之间的一致性在不同评估类别中有所不同。我们在四项指标——分析评价(AE)、建模严谨性(MR)、实用性与科学性(PS)以及结果与偏差分析(RBA)——上均观察到较高的一致性,这表明标注者之间具有较强的总体一致性。

模型—人类一致性

为了进一步评估标注的可靠性,我们在同一数据子集上将模型生成的分数与人类评估进行比较。模型与人类评估结果表现出合理的一致性,尤其是在 MR 和 PS 指标上。

尽管与其他指标相比,RBA 和 AE 的一致性相对较低,但这不一定意味着 MM-Agent 所生成的问题分析和结果分析质量存在不足。相反,我们认为,这反映了不同标注者在评价此类解释时所固有的主观性和差异性;文献 [48] 也讨论了这一现象。

E.5 案例研究

本节详细描述相关案例研究,说明 MM-Agent 如何对一道来自 MCM 竞赛的现实世界数学建模任务进行端到端问题求解。

在问题分析阶段,MM-Agent 从步骤 1:问题理解开始。它提取任务背景、数据集路径和变量描述等基本要素。例如,智能体识别出该建模任务要求使用名为 Wimbledon_featured_matches.csv 的数据集,量化网球比赛中的“势头”。智能体将建模目标解释为:构建一个框架,在考虑发球优势和内在随机性的同时,根据逐分比赛结果推断势头。

步骤 2:问题分解中,MM-Agent 将总体目标分解为四个连贯的子任务:

  1. 势头量化;
  2. 区分势头与随机性;
  3. 势头变化的预测建模;
  4. 跨领域泛化分析。

这一分解过程将开放式问题转化为可执行的组成部分。

步骤 3 涉及任务依赖分析。在该步骤中,MM-Agent 构建一个依赖图,以捕获子任务之间的逻辑关系和计算关系。例如,任务 1 被识别为基础性任务,而其余任务均建立在任务 1 的结果之上。这一结构确保智能体按照具有语义依据的建模顺序执行任务。

在建模和报告阶段,步骤 1 是分层建模知识检索。智能体根据任务描述,从分层数学建模库(HMML)中检索候选方法,其中包括用于势头估计的隐马尔可夫模型(Hidden Markov Models,HMM)、GARCH 模型和作战模型。

步骤 2 采用 Actor-Critic 迭代优化机制。Actor 模块提出初始建模方案,例如使用隐马尔可夫模型量化势头。随后,Critic 对该模型进行评估并返回结构化反馈,指出当前方法过度简化了非线性势头动态,由此促使 Actor 对方案进行修订,转而采用状态切换模型等更加合适的替代方案。

步骤 3 是代码生成与执行。MM-Agent 为所选建模流程生成 Python 代码。如果代码由于错误而执行失败,例如出现 FileNotFoundError,智能体会诊断问题并改进代码,持续这一过程,直至获得能够正常运行的版本。

最后一个阶段是构建解决方案报告。智能体首先起草一份初步大纲,其中包括摘要、问题重述、解决方案和结论等部分。随后,它以人类可读的 LaTeX 格式生成一份完整报告,反映整个建模工作流程。

Powered by Hexo & Theme Keep
This site is deployed on