在数学领域 11 个问题上超越人类数学家已知最佳结果,在 7 个问题刷新了 Google AlphaEvolve 的进化结果,刷新 SOTA。 在模拟 Kaggle 数据科学竞赛的 MLE-bench 评测中独立斩获 23 块金牌。 在相同任务下,与 OpenEvolve、ShinkaEvolve 等进化智能体对比:进化效率提升超 60%,迭代成功率 100%。
可能性空间巨大:成千上万种材料、不同的处理工艺、多种形状尺寸。 需要多轮迭代:不能一次性得出答案,必须「尝试 - 观察 - 调整」循环。 结果反馈延迟:只有完整实施后,才能知道效果如何。 需要积累智慧:每一次失败都应让下一次尝试更聪明。
PES 范式:为进化注入「科学家思维」 LoongFlow 没有将进化交给随机性,而是为每一次迭代设计了结构化的认知阶段:规划、执行、总结。这确保了每次尝试都是目的明确、过程可控、结果可学的,从根本上将「随机漫步」转变为「定向探索」。 混合进化记忆系统:构建专属的「战略智库」 框架为智能体配备了一套精密的经验管理系统。它不仅仅是存储过去的解决方案,更是按照策略与特征对其进行分类、索引与动态调取,确保历史智慧能被高效复用,防止探索陷入重复或僵局。
在 11 个问题上超越了人类数学家已知最佳结果。
在 7 个问题上超越谷歌 AlphaEvolve 的进化结果,刷新 SOTA。
进化效率提升超 60%:用最少的生成评估次数,发现最好的结果。 迭代成功率 100%:在多次重复实验中稳定达成目标,而基线方法常因陷入局部最优或进化太慢而失败。
Plan 规划:在生成新一代方案前,智能体会扮演「战略分析师」的角色。它首先深度分析当前采样方案,然后检索「战略智库」(混合进化记忆系统)中所有的历史经验与失败教训,最终制定出一份目标清晰、规避已知陷阱的「进化蓝图」。这从根本上杜绝了盲目尝试。 Execute 执行:「执行」阶段如同一个配备了全系专业工具包的智能施工队。其关键在于 「因题施策」 的动态适配能力:面对数学证明,它是严谨的「逻辑验证器」;编写代码时,它是即写即测的「交互解释器」;进行数据分析时,它又化身为高效的「智能查询生成器」。这种灵活性,结合「快速本地验证」机制,确保了高质量输出,从源头节省了计算资源。 Summarize 总结:行动之后,「总结」模块承担起「复盘官」的职责。它不满足于简单的得分,而是深入剖析「规划蓝图」与「执行结果」之间的差距,提炼出「为何成功或失败」的因果洞察。这些结构化的经验被转化为下一代规划时可检索的宝贵知识。
多岛模型:它在内部建立多个独立的「探索特区」,允许不同的技术路线并行发展,相互隔离又定期交流,有效维持了探索的多样性,避免思维过早趋同。 MAP-Elites:它如同一个多维的「杰出方案陈列馆」。系统不仅按成绩,更按行为特征(如算法复杂度、计算效率)对解决方案进行归档。这意味着,一个在某项特性上表现极佳但总分并非最高的方案,同样会被珍藏,为未来的跨界创新保留火种。 自适应玻尔兹曼选择:这个模块是智能的「资源调度官」。它根据种群探索的实时状态(如多样性熵值),动态调节关键参数,智能切换策略:是在全局鼓励冒险开拓新边疆,还是在局部集中力量深耕最优领地。
