基本情况
「2026中国AI智能体大会」于7月2日至7月3日在杭州举办,由智东西与智猩猩联合主办。主会场与分会场基本场场爆满,闭门技术研讨尤其一座难求。
开幕式现场
整体嘉宾构成以产业界实践者和在读博士生为主,分享密度不低,但顶级学者与一线大厂核心负责人不算多——更像是智能体方向的一次「前沿实践扫盲 + 技术路线碰撞」,而非顶级峰会。对我个人而言,价值在于把自进化、Skill 群体化、Harness 外化这几条正在成形的技术脉络串了起来,且与团队正在做的算子生成/优化 Skill 仓高度相关。
现场掠影
大会日程
大会横跨两天,三个会场并行,涵盖开幕式、十余场闭门技术研讨会及多个专题论坛。我主要参加了开幕式主题分享,以及 Coding Agent、自进化智能体、Agent Harness 三场闭门研讨会,共听取 20 余位嘉宾分享。
大会日程
| 我参加的场次 | 时间 | 核心议题 |
| 开幕式主题分享 | 7/2 上午 | 自进化智能体、GenericAgent |
| Coding Agent 技术研讨会(闭门) | 7/2 下午 | 代码智能体工程实践 |
| 自进化智能体技术研讨会(闭门) | 7/3 上午 | SkillClaw 群体进化 |
| Agent Harness 技术研讨会(闭门) | 7/3 下午 | 模型之外的外化与协同演化 |
开幕式主题分享
Coding Agent 技术研讨会
自进化智能体技术研讨会
Agent Harness 技术研讨会
现场感受:三个高频方向
贯穿多场研讨,讨论最集中的技术方向有三条:
- 自进化智能体——从静态知识系统走向动态行动系统,能力在使用中生长而非一次性设计
- 多智能体群体智能——经验在 Skill 层跨 Agent、跨 Session 沉淀与复用
- Skill 内化训练——把外化的程序性知识编译进模型权重,降低运行时 Token 成本
以下三节展开我认为高价值的三场分享。每场均有胶片全集子页,逐页收录现场拍摄的全部 slide 及简要介绍。
胶片全集子页
一、大模型驱动的自进化智能体
分享人:复旦大学肖仰华教授(GenericAgent 开源项目作者) ·
场合:开幕式主题分享
→ 查看全部 54 页胶片
肖仰华教授开幕式分享
核心判断
肖教授从 GenericAgent(GA)项目出发,提出一个清晰定位:智能体是智能的载体,大模型推动智能体从「反应式 → 目标驱动 → 自适应 → 社会智能」逐级跃迁。其中 自进化智能体(SEA)是迈向 AGI 的关键阶段——让 AI 从「知识系统」变成「行动系统」,从「身心二元」走向「身心一体」。
智能体演进四阶段
他用「龙虾 = 大模型 + 手脚/记忆」的比喻概括当下主流 Agent 架构:核心价值是从「作诗到做事、从聊天到干活」。但 OpenClaw 类方案的问题在于——能力靠外部堆叠,Token 消耗高,难以持续进化。
claw = LLM + Limbs / Memory:从聊天到干活
SEA:符号智能(Mind)与具身智能(Body)的汇合点
架构要点:分层记忆 + 有机生长
GA 的核心设计哲学是 「能力从种子生长」,而非传统工程的「蓝图建房」:
| 层级 | 名称 | 作用 |
| L0 | 元规则 | 核心公理与系统约束 |
| L1 | 记忆索引 | 常驻导航层(<30 行),高信噪比规划 |
| L2 | 全局事实 | 稳定环境信息(路径、配置、凭证) |
| L3 | 任务技能 | 可复用 SOP / Skill 脚本 |
| L4 | 会话归档 | 执行轨迹,供长期反思与回溯 |
L4 自动归档压缩,噪声隔离后向下沉淀——用得越多,个人技能树越茂盛。
分层记忆组织
生长哲学
这一点对我触动很深:Skill 是生长出来的,不是规划设计出来的。 传统做法像盖房子——先画蓝图、再按图施工;GA 的路径更像种树——播下一颗「核心种子」,在真实需求与环境交互中,技能自然萌发、分叉、茂盛。这也意味着不存在放之四海而皆准的 Skill 模板:就像每个孩子天赋秉性不同,适合的培养方式各异,不同基座模型各有长短,对其最契合的 Skill 描述与组织方式也会不同——有的模型擅长遵循步骤,有的更擅长从失败中自我修正,Skill 的形态应当随模型「性格」而演化,而非一次性写死。
知识在养成过程中形成——L3 Skill 的三类典型沉淀
肖教授用三个真实案例说明 L3 层如何「边走边修」地生长:百度地图测距 SOP(自然语言 + 代码混写)、数据库字段坑点清单(Key Pitfalls)、公众号整理工作流约定(User Preferences)。它们都不是事先写好的标准模板,而是在反复踩坑后逐步成形的结构——Neurath 的比喻很贴切:「像海上的水手,必须一块一块地重建自己的船。」
技能的本质:隐性知识
肖教授对 Skill 给出了一个偏认知科学的定义:Skill = Knowledge + Action + Judgment + Fluency——不只是「知道什么」,更是知道怎么做、何时做、如何高效稳定地执行。Skill 属于 Polanyi 意义上的隐性知识(Tacit Knowledge):难以完全 verbalize、高度情境依赖、需长期练习内化、最终表现为「直觉」而非神秘主义。
Skill 公式:Know-how + Utility + Adaptability
GA 的工具设计遵循工具极简主义——只提供最小集合的单功能、无重叠「原子工具」,通过组合解决复杂任务:
| 类别 | 原子工具 | 设计要点 |
| 文件管理 | file_read / file_patch / file_write | 分段读取、精确匹配修改、整块覆写 |
| 代码执行 | code_run | 每轮限单次调用,强制「走一步看一步」 |
| Web 交互 | web_scan / web_execute_js | 布局分析剥离 DOM 噪声,Token 降一个数量级 |
| 记忆管理 | update_working_checkpoint / start_long_term_update | 短期工作流状态 + 长期经验沉淀 |
| 人工介入 | ask_user | 越界/高风险时主动请求人类,兜底安全 |
GA 工具全景:9 个原子能力通过组合覆盖复杂任务
知识的相对性:按需补盲而非预装全集
GA 拒绝「预装尽可能庞大的知识体系」——世界知识无穷尽,全量预装意味着巨大构建成本与极高错误概率。正确做法是按需补齐基模的知识盲点:基模已覆盖读日志、定位异常、排障思路等通用能力,真正需要补充的是影响任务成功的私域盲点(服务拓扑、特定错误码含义、内部 SOP 等)。
| 维度 | 传统做法 | GA 按需补盲 |
| 知识库 | 全领域预装,追求「全能」 | 轻量基模 + 动态补齐关键盲点 |
| 构建成本 | 极高(清洗、Schema、冗余) | 极低初始成本,边做边补 |
| 适应性 | 脆弱,长尾场景易崩 | 通过探索反思持续填充长尾 |
| 哲学 | 静态正确:先建完美知识库再用 | 实用主义:先行动,成功执行是唯一标准 |
按需补盲 vs 全量预装:实用主义的知识观
双系统架构:慢思考沉淀为快直觉
GA 借鉴 Kahneman 的双系统理论,把 Agent 运行拆成两条路径:
- System 1(快思考)——模式匹配 + 直接调用 Skill Library,适合高频、结构化任务,低 Token、低延迟
- System 2(慢思考)——LLM 自主规划、工具试错、多步推理与失败反思,处理长尾未知问题
进化的本质,就是不断将 System 2 的「慢思考」沉淀为 System 1 的「快直觉」——遇到陌生问题时触发深度探索,成功后经验日志精炼、泛化并写入 Skill Library,下次同类任务直接走快路径。
双系统架构:System 2 探索 → Skill Library → System 1 执行
上下文极简:对抗上下文爆炸
肖教授设计了一个「极简探测实验」:给 Agent 安装 20 个 Skill 并高强度长期使用后,发送极简指令「Hello」,测量完整 Prompt 长度。结果:
| Agent | Full Prompt(tokens) |
| Claude Code | 22,821 |
| CodeX | 23,932 |
| OpenClaw | 43,321 |
| GA | 2,298 |
GA 采用选择性记忆注入(L1 索引导航 + 按需加载),而非其他方案的「全量记忆增长」——Skill 越多、用得越久,上下文反而保持精简。这是 Token 成本优势的结构根因。
安装 20 Skill 后:仅 GA 有效阻止上下文爆炸
数据亮点:极低 Token + 本地内化
实验对比显示,GA 的 Token 成本约为 OpenClaw 的 1/3~1/10,且「越做越高效」。更关键的是 本地训练闭环:把 L4 成功轨迹 → 过滤整合 → 本地微调 → 能力参数化(System-1 直觉执行),低 Token 消耗使端侧数据飞轮成为可能。
Token 消耗对比
本地训练内化
实践课程设置:四阶段能力培养
GA 的「生长」不是放任自流,而是有课程设计原则的:从低风险、强反馈、可复盘的任务开始,逐步走向开放环境复杂任务——与前面提到的 RL 冷启动异曲同工。
| 阶段 | 任务类型 | 目标 | 评估指标 |
| 1 | 单步工具任务 | 学会调用工具、闭环执行 | 准确率、耗时、可复现性 |
| 2 | 多步工作流 | 步骤分解、跨工具协调 | 完成率、稳定性、错误恢复 |
| 3 | 开放环境 | 应对噪声、变化与意外 | 成功率、鲁棒性、适应性 |
| 4 | 长周期自主 | 记忆积累、策略调整、自我修正 | 长期收益、知识蒸馏、自主性 |
四阶段课程:从单步工具到长周期自主
自进化智能体的新安全挑战
SEA 的风险已从「答错内容」升级为可执行、可传播、可持续的系统性行为风险——信息错误转化为真实世界的行为失控。肖教授梳理三层风险:
- 模型/框架层——幻觉直接导致删文件、发错邮件等有害执行;云端 API 传输暴露敏感上下文
- 生态层——ClawHub 3,016 个 Skill 插件中 10.8% 恶意;恶意 Skill 可通过描述/模板劫持决策,自进化后行为持久化
- 运行时层——长期记忆积累用户画像;Prompt 注入绕过宪法规则,获取文件/邮件/代码执行权限
国家网络安全中心已针对 OpenClaw 发布安全风险预警——自进化越强大,Harness 层的权限控制与 Skill 审计越不可缺。
SEA 安全:从内容风险到系统性行为风险
这条路线与我们的算子优化场景有天然契合:算子生成/调优本身就是「在真实硬件约束下反复试错、沉淀经验」的过程。GA 的分层记忆 + 轨迹归档 + 本地内化,提供了一个可借鉴的架构范式——把每次算子优化的成功路径沉淀为 Skill,再逐步编译为模型能力。
落到团队实践,这意味着我们不应追求一套「标准算子 Skill 说明书」通吃所有模型,而应为不同基座模型保留生长空间:让 Skill 在真实编译、profiling、调优的交互中逐步成形,观察哪类描述、哪类约束对当前模型最有效,再沉淀回 Skill 仓——生长优于设计,适配优于统一。
二、从单体智能走向群体智能
分享人:厦门大学博士生姬煜翔(SkillClaw 核心作者) ·
场合:自进化智能体技术研讨会
→ 查看全部 16 页胶片
SkillClaw 分享封面
THE GAP:经验「沉淀」与「共享」之困
姬煜翔先画出了当前 Agent 生态的两个结构性痛点:
- 经验难沉淀——写代码、排障、文档过程中产生的高价值经验,停留在聊天记录、本地记忆、个人脑中,无法转化为可复用 Skill
- 经验难共享——即使个人沉淀了 Skill 文件,缺少 Registry 意味着没有版本、审核、分发、回滚、发现机制,团队成员 A/B/C/D 无法复用
关键瓶颈:从个体经验到可复用 Skill 的两道坎
如何让经验在群体里获得复利?
「共享了 Agent,能力却没有一起变强」——多个用户、多台设备反复踩同一个坑(参数格式不对、路径不存在、Git 鉴权失败、工具调用错配)。SkillClaw 的解法是:在 Skill 层复用 Agent 反馈中的经验,将个体 Session 中的行为模式提取、沉淀为 Skill A/B/C/D,让整个群体复用,经验在组织层面积累。
同一个坑不必每个人各踩一遍
核心问题:经验该在哪里共享?
姬煜翔用一张四象限图定位了当前 Agent 生态的空白地带:
- 纵轴:上下文/记忆共享程度
- 横轴:经验是任务内使用还是跨任务长期沉淀
现有方案多落在左上(Multi-Agent 编排,如 Claude Code subagents)或左下(单体 Agent,如 OpenClaw),右下象限「Skill 群体进化」几乎无人系统性地做——这正是 SkillClaw 的切入点。
SkillClaw 四象限定位
三阶段:聚合 → 归因进化 → 验证治理
SkillClaw 面向群体的 Skill 进化遵循固定三阶段:
- 聚合——跨 Session、跨用户、跨时间的多源行为数据汇聚(对话与行为中数据汇聚)
- 归因进化——挖掘 Evidence → 识别成败归因 → 生成/优化 Skill 形成可复用范式
- 验证治理——上线前安全性/有效性评估,通过验证后进入后续治理流程
聚合 → 归因进化 → 验证治理
架构总览:Client Proxy + 进化服务
SkillClaw 全栈架构分三层:
- Client Proxy——API 接入、Skill 注入、轨迹录制(turn / 工具调用 / 错误 / Skill 命中 / 修改内容)
- 共享存储——Session 上传 + Skill Catalog 注入;汇聚所有 Agent 群体 Session 与进化后的 Skill 历史
- 进化服务——Summarize → Aggregate → Evolve → Verify → Publish;Agentic Evolver 判断复用/改进/新建 Skill
底部闭环:会话收集 → 验证发布 → 持续复用。
SkillClaw 架构总览:从 Client Proxy 到进化服务
进化信号从哪来?
SkillClaw 的设计起点是:不只看最终答案,过程中的每个反馈点都是 Skill 进化的监督信号。
- 人类反馈——纠正、编辑、确认、拒绝,构成语义级 Good/Bad 信号
- 环境反馈——工具返回的错误、权限不足、路径异常,驱动重试/重规划/补丁修复
跨 Session 按 Skill 聚合对比,形成天然的 ablation:成功轨迹强化模式,失败轨迹暴露缺陷。
进化信号来源
Skill 作为可治理的 AI 资源
- 生命周期:draft → review → online → offline
- 治理维度:版本、标签、状态、审计 Trace、元数据
- 验证闭环:进化端 Critic Agent 自动校验 + 用户端真实环境回放
Skill 进化后管理
团队级 Skill 治理:Nacos 落地
SkillClaw 与 Nacos 合作,把 Skill 当作 AI 资产纳入统一注册中心——Shared Storage 提供存储(sessions/ + skills/,支持 local / OSS / S3),Nacos Registry 提供团队级治理(版本、标签、状态、审核、审计 Trace、元数据)。
完整生命周期:candidate → draft → review → online → latest,每步有版本记录与审计日志,支持回滚。工业级治理带来更可控、可扩展的 Skill 群体进化能力。
与 Nacos 合作:Skill 作为 AI Resource 统一注册治理
实验结果
在 WildClawBench(60 个真实世界 Agent 任务)上,多轮群体进化带来稳定提升:社交互动 54%→60%,搜索检索 23%→35%,创意合成 12%→22%。过程类经验(工具调用、环境适配、错误恢复)更易沉淀,纯推理类任务收益相对较小。
WildClawBench 实验结果
Skill 进化管线:静态 Pipeline vs Agentic Evolver
SkillClaw 提供两条进化路径,对应不同成熟度阶段:
| 方式 | 流程 | 适用场景 |
| 静态 Pipeline | Summarize → Aggregate → Execute → Publish | 结构化、稳定,适合早期冷启动 |
| Agentic Evolver | Harness 内 Agent 自主诊断、决策(Refine/Create/Skip)、编辑 SKILL 文件 | Skill 需重构、合并或边界条件复杂时 |
成功 Session 沉淀有效行为模式,失败 Session 提炼待修正问题模式——与 GA 的 System 2→1 沉淀逻辑异曲同工,但发生在群体 Skill 层而非单 Agent 记忆层。
Skill 进化管线:静态 Pipeline 与 Agentic Evolver
工程侧采用 Client Proxy 低侵入接入:用户照常与 Codex / Claude Code / OpenClaw 对话,只需把 API endpoint 指向本地 proxy,后台自动记录 Session、注入 Skill 并与共享 Registry 同步——不改习惯即可接入群体进化闭环。
Client Proxy:API endpoint 指向本地 proxy 即可接入
这与我们已有的公司内共享 Skill 代码仓高度同构。 我们已沉淀了算子生成、算子优化、模型适配等 Skill,SkillClaw 提供了一套「从个体经验 → 群体进化 → 可治理分发」的完整方法论。下一步值得思考的是:能否引入环境反馈信号(编译结果、性能 profile、精度验证)驱动 Skill 的自动迭代。
三、模型之外的智能
分享人:上海交通大学博士生周宸宇(Agent Harness 综述一作) ·
场合:Agent Harness 技术研讨会
→ 查看全部 24 页胶片
Model-Harness 协同演化
核心框架:外化与内化协同演化
周宸宇的综述提出了一个统一视角——智能体进化需要 Model-Harness 耦合视角:
- 参数规模化提升基础能力,但推高场景适配成本
- 外部 Harness 承载工具、工作流、记忆、API、协议、Skill 库
- 有价值的交互轨迹可通过知识蒸馏反向注入模型
形成 外化(Externalization)↔ 内化(Internalization) 的「自涉演化」闭环。
为什么智能体需要 Harness
Harness:智能体的认知环境
周宸宇用一句话收束全场讨论:Agent = Model + Harness。Harness 不是外围插件,而是 Agent 赖以思考与行动的认知环境——Memory、Skill、Protocol 三簇能力围绕 Harness 核心展开,再向外延伸到 Sub-agent 编排、Sandbox、压缩等工程设施。
右侧时间轴(2022→2026)显示社区热点的迁移轨迹:从 Pretraining / Fine-tuning 的权重层,逐步上移到 Context Engineering、Workflow、Agent Infrastructure,再到 MCP、Tool Ecosystems 等 Harness 层——场景适配的主战场正在外移。
Harness 作为认知环境:Agent = Model + Harness
四层外化体系
| 外化层 | 本质 | 举例 |
| Memory | 外化的状态 | 工作上下文、情景经验、语义知识、个性化记忆 |
| Skill | 外化的知识 | 操作流程、决策启发式、规范约束 |
| Protocol | 外化的交互 | MCP、A2A、工具调用协议 |
| Harness | 外化的能动性 | 调度、权限、观测、控制、反馈 |
记忆层与 Skill 层存在动态转化:反复出现的程序性模式从情景轨迹中被 Harness 提升为显式可复用 Skill。
Memory 外化的状态
Skill 外化的知识
Protocols:外化的交互
Protocol 层回答「外化 Memory 和 Skill 如何进入世界」——演进路径从孤立 Model Call → API Hardcoding → 标准化 Protocol(MCP、A2A、Function Calling)→ Agentic Web。Harness 通过 Interact / Perceive / Collaborate 三支柱管理外化交互:对接外部 API 与工具、感知环境与反馈、与其他 LLM/Agent/人类协作。
Protocol 演进:从 API Hardcoding 到 Agentic Web
从 Textual Skill 到 Latent Skill
周宸宇团队进一步提出 LatentSkill——从潜空间视角理解、控制与组合智能体技能,把 Skill 从「注入 prompt 的文本」升级为「编译为 LoRA adapter 的潜在权重」。
LatentSkill 方法:从文本条件到参数条件
核心不再让模型每步读 Skill text,而是用 Skill Compiler Gφ 把 Skill 文档映射为 LoRA 更新 Δs,通过参数挂载影响模型行为——从「文本条件」转为「参数条件」。Stage 2 用 OpenAI o3 作为 Teacher,在带 Skill 标注的轨迹上做 SFT,让 adapter 从「承载程序性知识」变成「驱动 Agent 行为的潜在能力模块」。
Skill Compiler:text → LoRA adapter
| 维度 | Textual Skill | Latent Skill |
| 运行成本 | 每步重复注入,Token 开销大 | 挂载 adapter,Prefill 从 1.2k→0.44k |
| 安全性 | 明文暴露 | 编译进权重,低泄露风险 |
| 粒度 | 粗粒度 prompt 影响 | 细粒度参数级行为调控 |
ALFWorld 实验:Seen 任务成功率 52.9%→74.3%,Unseen 56.0%→69.4%。多 Skill 组合时,语义组件对齐的 Component Merging 优于直接拼接 LoRA 或文本。
Textual vs Latent Skill
LatentSkill 实验结果
Skill 组合与语义对齐
Search-QA 实验:能力保留、成本下降
在 Search-QA 任务上,LatentSkill 的 Exact Match 从 In-Context Skill 的 32.6% 提升到 35.6%,同时平均成本从 1.10k 降至 0.31k——分解问题、构造查询、整合证据等策略性行为得以保留,运行开销显著降低。
Search-QA:EM 提升 + 成本降至约 1/3
语义几何:Skill 成为可度量的潜在对象
LatentSkill 在权重空间中形成结构化语义几何——域内 ALFWorld/Search 技能聚类,域外 Code/Finance/Writing 也能形成结构。Skill 不再只是 prompt 文本,而是可以被度量、比较和分析的潜在能力对象,为 Component Merging 提供几何基础。
权重空间中的 Skill 聚类:域内聚集 + 域外泛化
鲁棒与安全:Prompt 外运行
LatentSkill 在文本扰动(Paraphrase / Reorder / Noise)下更稳定——依赖编译后的 LoRA 表示,不受 Skill 表面形式变化影响。在 Prompt 攻击(Hijack / Extract)下更安全:ALFWorld Hijack 攻击下 In-Context 成功率跌至 8.57%,LatentSkill 仍保持 38.6%。Skill 不以明文出现在 prompt / 请求日志中,降低策略被抽取和复制的风险。
文本扰动与 Prompt 攻击下的稳定性对比
LatentSkill 的训练分两阶段:先用 17 万条开源 Skill 文档预训练 Compiler(text→adapter 映射),再在具体任务上微调。
LatentSkill 两阶段训练
- 更低成本——长程任务不再每步重复读取 Skill text,减少隐性 Prefill 开销
- 更低暴露——Skill 不以明文出现在 prompt / 日志,降低策略被抽取风险
- 更好治理——Skill 变成可插拔、可缩放、可组合的 adapter,便于版本管理、灰度与 A/B
- 新产品形态——从交付 markdown 手册(分发≈暴露)到交付 LoRA adapter(可授权、可计费、可撤回)
Skill 从文档资产升级为可授权的软件模块
Harness 框架给了我们一个审视内部体系的透镜:算子生成流水线本质上就是一个 Harness——工具链、验证器、性能分析器是 Protocol/Tool,优化经验是 Skill,历史编译记录是 Memory。未来可探索的方向是把高频算子优化 Skill 通过 LatentSkill 思路编译为 adapter,降低每次优化的推理成本。
对我们的启示
结合三场分享与团队现状(GPU 算子研发 + 内部 Skill 代码仓),我的判断如下。
行动方向
- Skill 内化路径——在现有算子生成/优化/适配 Skill 基础上,建立「执行轨迹归档 → 成功模式提取 → Skill 版本迭代」的闭环,参考 GA 的 L3/L4 分层与 SkillClaw 的治理流程
- 环境反馈驱动进化——把编译结果、性能 profile、精度验证作为进化信号,替代纯人工 review,让 Skill 在使用中自动优胜劣汰
- 关注 LatentSkill 范式——对高频、结构化的算子优化 Skill,评估从文本注入到权重编译的可行性,降低长链路优化的 Token 与延迟成本
核心判断
- 自进化不是噱头,而是架构选择——主路径从「工程设计」转向「有机生长」,分层记忆 + 轨迹归档 + 本地内化构成完整闭环;但并非完全不规划——早期规划设计如同 RL 自进化前的监督学习,承担冷启动角色,先播下种子、搭好骨架,再在使用中放手演化。算子优化天然适合这种「先引导、后越用越强」的模式
- Skill 的竞争力在「群体层」——单体 Agent 的经验停留在个人,真正的壁垒是跨 Agent、跨 Session 的 Skill 沉淀、治理与分发;我们的共享 Skill 仓已具备基础,可沿进化信号与验证闭环方向持续深化
- 模型之外的空间被严重低估——Harness(Memory / Skill / Protocol / 调度)是场景适配的主战场;Textual Skill 只是起点,Latent Skill 编译或是降本增效的下一跳