报告人:陈增敬教授
报告题目:强化学习与数学大模型
报告时间:2026年9月1日(周二)14:00-17:00
报告地点:D2-220
摘要:随着大语言模型(LLM)在自然语言处理领域的突破,其在复杂逻辑推理与高精度数学计算方面的能力成为通往通用人工智能(AGI)的关键瓶颈。本报告聚焦于强化学习在提升数学大模型性能中的核心作用,探讨从基于人类反馈的强化学习(RLHF)到过程监督及探索性推理范式的演进路径。
报告人简介:陈增敬,山东大学教授,山东大学中泰证券金融研究院院长,山东国家应用数学中心执行委员会常务副主任。主要从事金融数学、倒向随机微分方程、非线性期望、计量经济学等领域的研究,先后在Econometrica、Journal of Economic Theory、Annals of Probability、Automatica 和Nature 子刊等期刊发表论文 80 余篇。在量子和非独立的框架下,给出了一类非线性正态分布分布密度的显示表达式。丰富和完善了彭实戈院士的非线性期望理论,并应用到金融领域,解决了资产定价领域中一些长期未解决的难题,在国内外产生了重要的影响。其中,与美国艺术与科学院士、著名经济学家 Epstein 合作发现了动态多先验资产定价理论与非线性g-期望之间的联系,得到了被称为 Chen-Epstein 的定价公式。该结果被诺贝尔经济奖获得者、国际数学家 (ICM) 报告人以及多位国际著名学者和专家引用或推广。曾先后获得第十四届孙冶方经济科学奖、国家自然科学二等奖和“五一”劳动奖章等诸多奖项。目前正在主持国家重点研发项目一项、山东省自然科学基金重大基础研究项目一项;曾主持国家杰出青年科学基金、国家自然科学基金重点项目各一项。
欢迎数理学院的师生前来听讲!