开幕式演讲封面
肖仰华教授在2026中国AI智能体大会开幕式发表题为「大模型驱动的自进化智能体:技术洞察与趋势展望」的主题演讲。封面展示了讲者肖像、复旦大学及上海市数据科学重点实验室身份,并标明大会主办机构智东西与智猩猩。
肖仰华教授在2026中国AI智能体大会开幕式发表题为「大模型驱动的自进化智能体:技术洞察与趋势展望」的主题演讲。封面展示了讲者肖像、复旦大学及上海市数据科学重点实验室身份,并标明大会主办机构智东西与智猩猩。
介绍 GenericAgent 的核心理念:智能体在每次使用中变得更聪明。通过手绘图标展示四大特性——全计算机控制、6 倍 Token 节省、自进化技能树、自动学习保存技能,并强调 100% 开源。
探讨智能从静态能力(知识、计算、记忆)到动态过程的历史转变。分别以专家系统、神经网络和搜索引擎为例,说明智能在三个维度上的演进。
给出智能的正式定义:在特定环境中为达成目的而进行感知、决策和行动的动态过程。从哲学、心理学、神经科学和认知科学四个角度引述杜威、斯金纳、弗里斯顿和麦卡锡等名家的观点。
对比「缸中之脑」与王阳明心学,指出智能不应是脱离肉体的纯心灵活动,而应是嵌入身体与环境中的能力。现代认知科学认为智能是具身化、情境化且通过行动体现的。
引用 Russell & Norvig 教材定义智能体为能感知环境、自主决策并采取行动以实现目标的系统。以欹器、扫地机器人和祝融号火星车为例说明不同时代智能体的形态。
指出与传统被动执行程序不同,智能体具备自主行动与持续交互能力。展示感知→思考→行动→反馈的四阶段闭环,并将「思考」环节标红突出为核心。
梳理从 1950 年图灵测试到 2022 年后 LLM Agents 的认知引擎演进历程。时间轴涵盖符号逻辑、专家系统、机器学习、深度学习和 LLM Agent 五个技术时代。
强调 LLM 的开放世界知识与反思能力极大提升了智能体的思考与决策水平。左侧架构图展示语言智能体与具身智能体在多样化环境中的交互逻辑,右侧为复杂社交环境模拟案例。
将智能体演进划分为反应式、目标驱动、自适应和社交智能四阶段,并标红突出「自适应智能」阶段。自进化智能体被定位为实现环境适应性与自主性的关键跃迁。
定义自进化智能体为能持续与环境交互、自主发现不足、经验沉淀复用并持续自我改进的系统。核心展示环境交互→发现局限→知识积累→持续改进的四阶段循环模型。
SEA 使 AI 从知识系统变为行动系统,符号 AI(心智发展)与具身 AI(身体发展)两条路径汇聚于 SEA,最终通向 AGI 的「终极时刻」。
用「龙虾 = 大模型 + 手脚/记忆」概括当下主流 Agent 架构,核心价值是推动 AI 从作诗到做事、从聊天到干活的跨越。
GA 专场标题页:「GenericAgent (GA):一个自进化智能体」,副标题为 A Token Efficient Self-Evolving Autonomous LLM Agent by Maximizing Context Information Density。
对比 GA 与 OpenClaw 在代码规模、学习能力、工具体系、国产场景和安全部署等维度的差异。展示 GA 开源后登顶 GitHub Trending 榜首、获 13.2K stars 的热度数据。
介绍自研 DataHub-Skills 资源库,已聚合 140 万个技能。展示智能体通过技能探索与组合,在零人工干预下自主学习完成小红书发帖等复杂任务的案例。
展示 GenericAgent 的社会影响力:相关话题多次登顶微博热搜,央视持续报道阅读量超 44 万,20 余家主流媒体跟进报道。
详细介绍 GA 全链路自主进化能力,包括自主技能搜索、Sub-Agent 协同、心跳驱动内核、长任务弹性规划、网页视觉控制和未知数据探索等模块。Lifelong Bench 上 GA 在 Claude Sonnet 4.6 和 Minimax M2.7 底座上分别达到 100% 和 90% 成功率。
阐述 GA 从静态工具到主动进化的范式跃迁,展示闭环元认知体系(动态能力生成、深度知识沉淀、自我审视、闭环质量控制)。右侧提供 Python 代码调用示例。
对比 GA、OpenClaw 和 Claude Code 在复杂任务上的 Token 消耗,GA 仅为 OpenClaw 的 1/3~1/10。总 Token 数 GA 188,829 vs OpenClaw 633,101 vs Claude Code 537,413,且保持高成功率。
展示六层自进化能力金字塔(从工具自创到自我复制),并从「高自主性智能体」和「人工主体雏形」两个维度阐述 GA 的环境适应、策略反思及身份连续性等高级认知特征。
指出 Agent 瓶颈已从模型能力转向系统上下文管理,多轮执行产生的冗余数据淹没关键信息。强调用最少的 Token 办最复杂的事是通往通用 AI 的必经之路。
通过「Lost in the Middle」和有效长度天花板两组数据,说明基座模型上下文长度存在结构性限制。底部金句:在智能体设计中,极简才是最高级的克制。
提出「密度优于长度」的核心观点,对比臃肿上下文与高效工作记忆,并引入完备性、简洁性与自然性构成的「上下文不可能三角」(Context Trilemma)。
强调最大化信息密度是上下文管理的基本原则而非可选优化,引用「压缩即智能」和 Hutter Prize。展示从外部辅助元素到高密度 Prompt 的上下文工程漏斗流程。
智能设计的本质是做减法,找到最小完备能力集:工具接口、上下文管理和记忆建模三大支柱。以雅虎 vs 谷歌对比说明聚焦核心能力的重要性。
阐述工具冗余是智能体的「隐性杀手」,对比穷举式与组合式架构。实验数据表明精简工具集配合 DFSDT 算法在大模型工具调用上显著优于传统 ReACT 方法。
通过 Claude Code、OpenDevin 和 GenericAgent 的工具调用分布数据,证明工具调用呈长尾分布,少数高频工具承担绝大部分任务,大而全的工具箱是伪需求。
展示 GA 工具极简主义设计:文件管理、代码执行、网页交互、记忆管理和人工干预 5 大类 9 个原子工具,通过组合解决复杂任务而非开发复杂单一工具。
对比传统「蓝图建房」工程范式与「播下种子」有机生长范式,引用 Lehman 软件演化定律。右侧展示 GA 在实际使用中「长出来」的股票监控流程案例。
技能树是智能体的能力清单与学习导航,通过对效用(35%)、广度(25%)、深度(25%)和创新(15%)四维度加权计算,确保自主探索是需求驱动而非随机游走。
通过 HTML 简化、历史标签截断、滑动窗口和按需注入四层过滤,将上下文控制在 30K 以内即可达到传统框架 200K-1M 的效果,最高节省约 90% Token。
极简探测实验:安装 20 个 Skill 并高强度使用后发送「Hello」,测量 Full Prompt 长度。仅 GA 保持 2,298 tokens(Claude Code 22,821、OpenClaw 43,321),有效阻止上下文爆炸。
在 SOP-Bench、Lifelong AgentBench 等基准上,GA 以更少 Token 实现更高准确率。Lifelong AgentBench 上 GA 仅消耗 Claude Code 的 27.7%、OpenClaw 的 15.5% Token 即达 100% 完成率。
GA 核心架构为 L0 元规则、L1 洞察索引(≤30 行)、L2 全局事实、L3 任务技能、L4 会话归档五层记忆。L4 自动归档压缩、分层噪声隔离,L1 作为常驻导航层保持高信噪比规划环境。
展示自进化的「记住、提取、应用」闭环流程,以及四条铁律(无行动不记忆、神圣不可更改、禁止存储易变状态、最小充分指标)。引用杜威名言:「我们并不是从经验中学习,而是从对经验的反思中学习。」
五轮重复任务实验中,仅 GA 的时间和 Token 消耗随迭代显著下降,其他模型基本持平。进化并非简单记忆聊天记录,而是将经验提炼为可复用的 L3 级 SOP。
第二部分章节过渡页:「自进化智能体的技术洞察 / GenericAgent Technical Insights」,标志演讲从技术背景转入 GA 核心架构与方法论深入剖析。
将 Skill 定义为 Knowledge + Action + Judgment + Fluency 构成的隐性知识(Tacit Knowledge)。技能难以完全言传、高度情境依赖、需长期实践内化,最终表现为「直觉」,引用波兰尼「We know more than we can tell」。
技能表示非绝对客观,与基座模型「认知天赋」高度相关。同任务下 Claude 4.6 生成可迁移方法模板,Qwen 3.5 则给出含具体 URL 和操作细节的执行 SOP。
在人类专家监督下的探索式学习将专家经验结晶为动态专家技能库。展示 Supervisor.Skills 项目涵盖论文选题、写作、绘图等六章研究技能内容。
大模型降低了对知识规范性的要求,Wiki、SOP、专家经验等非结构化形式均可驱动任务执行。核心观点:知识仍然不可或缺,但内容重于形式。
知识不是一次性设计的成品,而是在问题中边走边修逐步长成的结构。展示百度地图测距 SOP、数据库字段坑点清单和公众号整理工作流三个真实 L3 沉淀案例,引用 Neurath 修船比喻。
真正有价值的知识难以先验表达,需在实践中实验、校正、沉淀。四步流程:进入任务→暴露盲点→获取反馈→固化知识。以智能体学习百度地图测距工具测量篮球场的案例说明。
对比传统全量预装与 GA「按需补盲」两种知识观。世界知识无穷尽,应轻量基模 + 动态补齐影响任务成功的私域盲点,以实用主义替代静态正确。
对比命令式架构与 SEA 目标导向架构:从极细粒度「如何做」到高度抽象「做什么」,认知负荷由系统内部元认知引擎接管。展示认知系统、记忆机制与工具集成的技术架构图。
System 1(快思考)依托技能库模式匹配执行高频任务,System 2(慢思考)由 LLM 自主规划、工具试错处理长尾未知。进化本质是将慢思考沉淀为快直觉。
四阶段课程:单步工具任务→多步工作流→开放环境任务→长周期自主任务,每阶段设明确学习目标与评估指标。设计原则是从低风险、强反馈、可复盘任务逐步走向开放环境复杂任务。
将 L4 成功轨迹经整合过滤后通过本地微调内化为模型参数,实现 System-1 式直觉执行。低 Token 消耗使端侧数据飞轮成为可能,对比 OpenClaw-RL 云端训练方案。
自进化代理重塑企业组织架构,展示组织智能体(协调者)连接人类成员与数字助手的框架。借鉴唐代三省制等历史制度拓扑研究,发现最优架构因模型而异。
传统评测过度依赖孤立任务片段和静态成功率,SEA-Eval 聚焦评估连续任务序列中的进化增益、进化稳定性和隐式对齐收敛能力。GA 相较 OpenClaw 展现更稳定的进化增益。
SEA 风险从内容错误升级为可执行、可传播、可持续的系统性行为风险。梳理模型/框架层、生态层和运行时层三层风险,引用国家对 OpenClaw 的安全预警。
安全目标非永不犯错,而是确保可控、可观测、可恢复。介绍 SafeHarness 四层防御框架:INFORM(输入处理)、VERIFY(决策验证)、CONSTRAIN(动作约束)、CORRECT(状态纠正)。
演讲结束致谢页,借用老子「无为而无不为」寓意自进化智能体追求的最高境界。展示 GenericAgent 项目二维码与技术报告链接,邀请扫码了解更多。