参会分享 · 内部

2026中国AI智能体大会
参会记实

2026.07.02 – 07.03 · 杭州 智东西 × 智猩猩 联合主办

基本情况

「2026中国AI智能体大会」于7月2日至7月3日在杭州举办,由智东西与智猩猩联合主办。主会场与分会场基本场场爆满,闭门技术研讨尤其一座难求。

开幕式现场
开幕式现场

整体嘉宾构成以产业界实践者和在读博士生为主,分享密度不低,但顶级学者与一线大厂核心负责人不算多——更像是智能体方向的一次「前沿实践扫盲 + 技术路线碰撞」,而非顶级峰会。对我个人而言,价值在于把自进化、Skill 群体化、Harness 外化这几条正在成形的技术脉络串了起来,且与团队正在做的算子生成/优化 Skill 仓高度相关。

现场掠影
现场掠影

大会日程

大会横跨两天,三个会场并行,涵盖开幕式、十余场闭门技术研讨会及多个专题论坛。我主要参加了开幕式主题分享,以及 Coding Agent、自进化智能体、Agent Harness 三场闭门研讨会,共听取 20 余位嘉宾分享。

大会日程
大会日程
我参加的场次时间核心议题
开幕式主题分享7/2 上午自进化智能体、GenericAgent
Coding Agent 技术研讨会(闭门)7/2 下午代码智能体工程实践
自进化智能体技术研讨会(闭门)7/3 上午SkillClaw 群体进化
Agent Harness 技术研讨会(闭门)7/3 下午模型之外的外化与协同演化
开幕式主题分享
开幕式主题分享
Coding Agent 技术研讨会
Coding Agent 技术研讨会
自进化智能体技术研讨会
自进化智能体技术研讨会
Agent Harness 技术研讨会
Agent Harness 技术研讨会

一、大模型驱动的自进化智能体

分享人:复旦大学肖仰华教授(GenericAgent 开源项目作者) ·  场合:开幕式主题分享
→ 查看全部 54 页胶片
肖仰华教授开幕式分享
肖仰华教授开幕式分享

核心判断

肖教授从 GenericAgent(GA)项目出发,提出一个清晰定位:智能体是智能的载体,大模型推动智能体从「反应式 → 目标驱动 → 自适应 → 社会智能」逐级跃迁。其中 自进化智能体(SEA)是迈向 AGI 的关键阶段——让 AI 从「知识系统」变成「行动系统」,从「身心二元」走向「身心一体」。

智能体演进四阶段
智能体演进四阶段

他用「龙虾 = 大模型 + 手脚/记忆」的比喻概括当下主流 Agent 架构:核心价值是从「作诗到做事、从聊天到干活」。但 OpenClaw 类方案的问题在于——能力靠外部堆叠,Token 消耗高,难以持续进化

龙虾架构比喻
claw = LLM + Limbs / Memory:从聊天到干活
SEA 迈向 AGI
SEA:符号智能(Mind)与具身智能(Body)的汇合点

架构要点:分层记忆 + 有机生长

GA 的核心设计哲学是 「能力从种子生长」,而非传统工程的「蓝图建房」:

层级名称作用
L0元规则核心公理与系统约束
L1记忆索引常驻导航层(<30 行),高信噪比规划
L2全局事实稳定环境信息(路径、配置、凭证)
L3任务技能可复用 SOP / Skill 脚本
L4会话归档执行轨迹,供长期反思与回溯

L4 自动归档压缩,噪声隔离后向下沉淀——用得越多,个人技能树越茂盛。

分层记忆组织
分层记忆组织
生长哲学
生长哲学

这一点对我触动很深:Skill 是生长出来的,不是规划设计出来的。 传统做法像盖房子——先画蓝图、再按图施工;GA 的路径更像种树——播下一颗「核心种子」,在真实需求与环境交互中,技能自然萌发、分叉、茂盛。这也意味着不存在放之四海而皆准的 Skill 模板:就像每个孩子天赋秉性不同,适合的培养方式各异,不同基座模型各有长短,对其最契合的 Skill 描述与组织方式也会不同——有的模型擅长遵循步骤,有的更擅长从失败中自我修正,Skill 的形态应当随模型「性格」而演化,而非一次性写死。

知识在养成过程中形成
知识在养成过程中形成——L3 Skill 的三类典型沉淀

肖教授用三个真实案例说明 L3 层如何「边走边修」地生长:百度地图测距 SOP(自然语言 + 代码混写)、数据库字段坑点清单(Key Pitfalls)、公众号整理工作流约定(User Preferences)。它们都不是事先写好的标准模板,而是在反复踩坑后逐步成形的结构——Neurath 的比喻很贴切:「像海上的水手,必须一块一块地重建自己的船。」

技能的本质:隐性知识

肖教授对 Skill 给出了一个偏认知科学的定义:Skill = Knowledge + Action + Judgment + Fluency——不只是「知道什么」,更是知道怎么做、何时做、如何高效稳定地执行。Skill 属于 Polanyi 意义上的隐性知识(Tacit Knowledge):难以完全 verbalize、高度情境依赖、需长期练习内化、最终表现为「直觉」而非神秘主义。

技能的本质
Skill 公式:Know-how + Utility + Adaptability

工具极简主义:5 大类 9 个原子能力

GA 的工具设计遵循工具极简主义——只提供最小集合的单功能、无重叠「原子工具」,通过组合解决复杂任务:

类别原子工具设计要点
文件管理file_read / file_patch / file_write分段读取、精确匹配修改、整块覆写
代码执行code_run每轮限单次调用,强制「走一步看一步」
Web 交互web_scan / web_execute_js布局分析剥离 DOM 噪声,Token 降一个数量级
记忆管理update_working_checkpoint / start_long_term_update短期工作流状态 + 长期经验沉淀
人工介入ask_user越界/高风险时主动请求人类,兜底安全
GA 工具全景图
GA 工具全景:9 个原子能力通过组合覆盖复杂任务

知识的相对性:按需补盲而非预装全集

GA 拒绝「预装尽可能庞大的知识体系」——世界知识无穷尽,全量预装意味着巨大构建成本与极高错误概率。正确做法是按需补齐基模的知识盲点:基模已覆盖读日志、定位异常、排障思路等通用能力,真正需要补充的是影响任务成功的私域盲点(服务拓扑、特定错误码含义、内部 SOP 等)。

维度传统做法GA 按需补盲
知识库全领域预装,追求「全能」轻量基模 + 动态补齐关键盲点
构建成本极高(清洗、Schema、冗余)极低初始成本,边做边补
适应性脆弱,长尾场景易崩通过探索反思持续填充长尾
哲学静态正确:先建完美知识库再用实用主义:先行动,成功执行是唯一标准
知识的相对性
按需补盲 vs 全量预装:实用主义的知识观

双系统架构:慢思考沉淀为快直觉

GA 借鉴 Kahneman 的双系统理论,把 Agent 运行拆成两条路径:

  • System 1(快思考)——模式匹配 + 直接调用 Skill Library,适合高频、结构化任务,低 Token、低延迟
  • System 2(慢思考)——LLM 自主规划、工具试错、多步推理与失败反思,处理长尾未知问题

进化的本质,就是不断将 System 2 的「慢思考」沉淀为 System 1 的「快直觉」——遇到陌生问题时触发深度探索,成功后经验日志精炼、泛化并写入 Skill Library,下次同类任务直接走快路径。

双系统架构
双系统架构:System 2 探索 → Skill Library → System 1 执行

上下文极简:对抗上下文爆炸

肖教授设计了一个「极简探测实验」:给 Agent 安装 20 个 Skill 并高强度长期使用后,发送极简指令「Hello」,测量完整 Prompt 长度。结果:

AgentFull Prompt(tokens)
Claude Code22,821
CodeX23,932
OpenClaw43,321
GA2,298

GA 采用选择性记忆注入(L1 索引导航 + 按需加载),而非其他方案的「全量记忆增长」——Skill 越多、用得越久,上下文反而保持精简。这是 Token 成本优势的结构根因。

上下文极简实验
安装 20 Skill 后:仅 GA 有效阻止上下文爆炸

数据亮点:极低 Token + 本地内化

实验对比显示,GA 的 Token 成本约为 OpenClaw 的 1/3~1/10,且「越做越高效」。更关键的是 本地训练闭环:把 L4 成功轨迹 → 过滤整合 → 本地微调 → 能力参数化(System-1 直觉执行),低 Token 消耗使端侧数据飞轮成为可能。

Token 消耗对比
Token 消耗对比
本地训练内化
本地训练内化

实践课程设置:四阶段能力培养

GA 的「生长」不是放任自流,而是有课程设计原则的:从低风险、强反馈、可复盘的任务开始,逐步走向开放环境复杂任务——与前面提到的 RL 冷启动异曲同工。

阶段任务类型目标评估指标
1单步工具任务学会调用工具、闭环执行准确率、耗时、可复现性
2多步工作流步骤分解、跨工具协调完成率、稳定性、错误恢复
3开放环境应对噪声、变化与意外成功率、鲁棒性、适应性
4长周期自主记忆积累、策略调整、自我修正长期收益、知识蒸馏、自主性
实践课程设置
四阶段课程:从单步工具到长周期自主

自进化智能体的新安全挑战

SEA 的风险已从「答错内容」升级为可执行、可传播、可持续的系统性行为风险——信息错误转化为真实世界的行为失控。肖教授梳理三层风险:

  • 模型/框架层——幻觉直接导致删文件、发错邮件等有害执行;云端 API 传输暴露敏感上下文
  • 生态层——ClawHub 3,016 个 Skill 插件中 10.8% 恶意;恶意 Skill 可通过描述/模板劫持决策,自进化后行为持久化
  • 运行时层——长期记忆积累用户画像;Prompt 注入绕过宪法规则,获取文件/邮件/代码执行权限

国家网络安全中心已针对 OpenClaw 发布安全风险预警——自进化越强大,Harness 层的权限控制与 Skill 审计越不可缺。

自进化智能体安全
SEA 安全:从内容风险到系统性行为风险
这条路线与我们的算子优化场景有天然契合:算子生成/调优本身就是「在真实硬件约束下反复试错、沉淀经验」的过程。GA 的分层记忆 + 轨迹归档 + 本地内化,提供了一个可借鉴的架构范式——把每次算子优化的成功路径沉淀为 Skill,再逐步编译为模型能力

落到团队实践,这意味着我们不应追求一套「标准算子 Skill 说明书」通吃所有模型,而应为不同基座模型保留生长空间:让 Skill 在真实编译、profiling、调优的交互中逐步成形,观察哪类描述、哪类约束对当前模型最有效,再沉淀回 Skill 仓——生长优于设计,适配优于统一

二、从单体智能走向群体智能

分享人:厦门大学博士生姬煜翔(SkillClaw 核心作者) ·  场合:自进化智能体技术研讨会
→ 查看全部 16 页胶片
SkillClaw 分享封面
SkillClaw 分享封面

THE GAP:经验「沉淀」与「共享」之困

姬煜翔先画出了当前 Agent 生态的两个结构性痛点:

  • 经验难沉淀——写代码、排障、文档过程中产生的高价值经验,停留在聊天记录、本地记忆、个人脑中,无法转化为可复用 Skill
  • 经验难共享——即使个人沉淀了 Skill 文件,缺少 Registry 意味着没有版本、审核、分发、回滚、发现机制,团队成员 A/B/C/D 无法复用
经验沉淀与共享之困
关键瓶颈:从个体经验到可复用 Skill 的两道坎

如何让经验在群体里获得复利?

「共享了 Agent,能力却没有一起变强」——多个用户、多台设备反复踩同一个坑(参数格式不对、路径不存在、Git 鉴权失败、工具调用错配)。SkillClaw 的解法是:在 Skill 层复用 Agent 反馈中的经验,将个体 Session 中的行为模式提取、沉淀为 Skill A/B/C/D,让整个群体复用,经验在组织层面积累。

经验复利
同一个坑不必每个人各踩一遍

核心问题:经验该在哪里共享?

姬煜翔用一张四象限图定位了当前 Agent 生态的空白地带:

  • 纵轴:上下文/记忆共享程度
  • 横轴:经验是任务内使用还是跨任务长期沉淀

现有方案多落在左上(Multi-Agent 编排,如 Claude Code subagents)或左下(单体 Agent,如 OpenClaw),右下象限「Skill 群体进化」几乎无人系统性地做——这正是 SkillClaw 的切入点。

SkillClaw 四象限定位
SkillClaw 四象限定位

三阶段:聚合 → 归因进化 → 验证治理

SkillClaw 面向群体的 Skill 进化遵循固定三阶段:

SkillClaw 三阶段
聚合 → 归因进化 → 验证治理

架构总览:Client Proxy + 进化服务

SkillClaw 全栈架构分三层:

  • Client Proxy——API 接入、Skill 注入、轨迹录制(turn / 工具调用 / 错误 / Skill 命中 / 修改内容)
  • 共享存储——Session 上传 + Skill Catalog 注入;汇聚所有 Agent 群体 Session 与进化后的 Skill 历史
  • 进化服务——Summarize → Aggregate → Evolve → Verify → Publish;Agentic Evolver 判断复用/改进/新建 Skill

底部闭环:会话收集 → 验证发布 → 持续复用

SkillClaw 架构总览
SkillClaw 架构总览:从 Client Proxy 到进化服务

进化信号从哪来?

SkillClaw 的设计起点是:不只看最终答案,过程中的每个反馈点都是 Skill 进化的监督信号

  • 人类反馈——纠正、编辑、确认、拒绝,构成语义级 Good/Bad 信号
  • 环境反馈——工具返回的错误、权限不足、路径异常,驱动重试/重规划/补丁修复

跨 Session 按 Skill 聚合对比,形成天然的 ablation:成功轨迹强化模式,失败轨迹暴露缺陷。

进化信号来源
进化信号来源

Skill 作为可治理的 AI 资源

  • 生命周期:draft → review → online → offline
  • 治理维度:版本、标签、状态、审计 Trace、元数据
  • 验证闭环:进化端 Critic Agent 自动校验 + 用户端真实环境回放
Skill 进化后管理
Skill 进化后管理

团队级 Skill 治理:Nacos 落地

SkillClaw 与 Nacos 合作,把 Skill 当作 AI 资产纳入统一注册中心——Shared Storage 提供存储(sessions/ + skills/,支持 local / OSS / S3),Nacos Registry 提供团队级治理(版本、标签、状态、审核、审计 Trace、元数据)。

完整生命周期:candidate → draft → review → online → latest,每步有版本记录与审计日志,支持回滚。工业级治理带来更可控、可扩展的 Skill 群体进化能力。

Nacos Skill 治理
与 Nacos 合作:Skill 作为 AI Resource 统一注册治理

实验结果

在 WildClawBench(60 个真实世界 Agent 任务)上,多轮群体进化带来稳定提升:社交互动 54%→60%,搜索检索 23%→35%,创意合成 12%→22%。过程类经验(工具调用、环境适配、错误恢复)更易沉淀,纯推理类任务收益相对较小。

WildClawBench 实验结果
WildClawBench 实验结果

Skill 进化管线:静态 Pipeline vs Agentic Evolver

SkillClaw 提供两条进化路径,对应不同成熟度阶段:

方式流程适用场景
静态 PipelineSummarize → Aggregate → Execute → Publish结构化、稳定,适合早期冷启动
Agentic EvolverHarness 内 Agent 自主诊断、决策(Refine/Create/Skip)、编辑 SKILL 文件Skill 需重构、合并或边界条件复杂时

成功 Session 沉淀有效行为模式,失败 Session 提炼待修正问题模式——与 GA 的 System 2→1 沉淀逻辑异曲同工,但发生在群体 Skill 层而非单 Agent 记忆层。

Skill 进化管线
Skill 进化管线:静态 Pipeline 与 Agentic Evolver

工程侧采用 Client Proxy 低侵入接入:用户照常与 Codex / Claude Code / OpenClaw 对话,只需把 API endpoint 指向本地 proxy,后台自动记录 Session、注入 Skill 并与共享 Registry 同步——不改习惯即可接入群体进化闭环。

Client Proxy 低侵入接入
Client Proxy:API endpoint 指向本地 proxy 即可接入
这与我们已有的公司内共享 Skill 代码仓高度同构。 我们已沉淀了算子生成、算子优化、模型适配等 Skill,SkillClaw 提供了一套「从个体经验 → 群体进化 → 可治理分发」的完整方法论。下一步值得思考的是:能否引入环境反馈信号(编译结果、性能 profile、精度验证)驱动 Skill 的自动迭代。

三、模型之外的智能

分享人:上海交通大学博士生周宸宇(Agent Harness 综述一作) ·  场合:Agent Harness 技术研讨会
→ 查看全部 24 页胶片
Model-Harness 协同演化
Model-Harness 协同演化

核心框架:外化与内化协同演化

周宸宇的综述提出了一个统一视角——智能体进化需要 Model-Harness 耦合视角

  • 参数规模化提升基础能力,但推高场景适配成本
  • 外部 Harness 承载工具、工作流、记忆、API、协议、Skill 库
  • 有价值的交互轨迹可通过知识蒸馏反向注入模型

形成 外化(Externalization)↔ 内化(Internalization) 的「自涉演化」闭环。

为什么智能体需要 Harness
为什么智能体需要 Harness

Harness:智能体的认知环境

周宸宇用一句话收束全场讨论:Agent = Model + Harness。Harness 不是外围插件,而是 Agent 赖以思考与行动的认知环境——Memory、Skill、Protocol 三簇能力围绕 Harness 核心展开,再向外延伸到 Sub-agent 编排、Sandbox、压缩等工程设施。

右侧时间轴(2022→2026)显示社区热点的迁移轨迹:从 Pretraining / Fine-tuning 的权重层,逐步上移到 Context Engineering、Workflow、Agent Infrastructure,再到 MCP、Tool Ecosystems 等 Harness 层——场景适配的主战场正在外移

Harness 认知环境
Harness 作为认知环境:Agent = Model + Harness

四层外化体系

外化层本质举例
Memory外化的状态工作上下文、情景经验、语义知识、个性化记忆
Skill外化的知识操作流程、决策启发式、规范约束
Protocol外化的交互MCP、A2A、工具调用协议
Harness外化的能动性调度、权限、观测、控制、反馈

记忆层与 Skill 层存在动态转化:反复出现的程序性模式从情景轨迹中被 Harness 提升为显式可复用 Skill。

Memory 外化的状态
Memory 外化的状态
Skill 外化的知识
Skill 外化的知识

Protocols:外化的交互

Protocol 层回答「外化 Memory 和 Skill 如何进入世界」——演进路径从孤立 Model Call → API Hardcoding → 标准化 Protocol(MCP、A2A、Function Calling)→ Agentic Web。Harness 通过 Interact / Perceive / Collaborate 三支柱管理外化交互:对接外部 API 与工具、感知环境与反馈、与其他 LLM/Agent/人类协作。

Protocols 外化的交互
Protocol 演进:从 API Hardcoding 到 Agentic Web

从 Textual Skill 到 Latent Skill

周宸宇团队进一步提出 LatentSkill——从潜空间视角理解、控制与组合智能体技能,把 Skill 从「注入 prompt 的文本」升级为「编译为 LoRA adapter 的潜在权重」。

LatentSkill 方法:从文本条件到参数条件

核心不再让模型每步读 Skill text,而是用 Skill Compiler Gφ 把 Skill 文档映射为 LoRA 更新 Δs,通过参数挂载影响模型行为——从「文本条件」转为「参数条件」。Stage 2 用 OpenAI o3 作为 Teacher,在带 Skill 标注的轨迹上做 SFT,让 adapter 从「承载程序性知识」变成「驱动 Agent 行为的潜在能力模块」。

LatentSkill 方法定义
Skill Compiler:text → LoRA adapter
维度Textual SkillLatent Skill
运行成本每步重复注入,Token 开销大挂载 adapter,Prefill 从 1.2k→0.44k
安全性明文暴露编译进权重,低泄露风险
粒度粗粒度 prompt 影响细粒度参数级行为调控

ALFWorld 实验:Seen 任务成功率 52.9%→74.3%,Unseen 56.0%→69.4%。多 Skill 组合时,语义组件对齐的 Component Merging 优于直接拼接 LoRA 或文本。

Textual vs Latent Skill
Textual vs Latent Skill
LatentSkill 实验结果
LatentSkill 实验结果
Skill 组合与语义对齐
Skill 组合与语义对齐

在 Search-QA 任务上,LatentSkill 的 Exact Match 从 In-Context Skill 的 32.6% 提升到 35.6%,同时平均成本从 1.10k 降至 0.31k——分解问题、构造查询、整合证据等策略性行为得以保留,运行开销显著降低。

Search-QA 实验结果
Search-QA:EM 提升 + 成本降至约 1/3

语义几何:Skill 成为可度量的潜在对象

LatentSkill 在权重空间中形成结构化语义几何——域内 ALFWorld/Search 技能聚类,域外 Code/Finance/Writing 也能形成结构。Skill 不再只是 prompt 文本,而是可以被度量、比较和分析的潜在能力对象,为 Component Merging 提供几何基础。

LatentSkill 语义几何
权重空间中的 Skill 聚类:域内聚集 + 域外泛化

鲁棒与安全:Prompt 外运行

LatentSkill 在文本扰动(Paraphrase / Reorder / Noise)下更稳定——依赖编译后的 LoRA 表示,不受 Skill 表面形式变化影响。在 Prompt 攻击(Hijack / Extract)下更安全:ALFWorld Hijack 攻击下 In-Context 成功率跌至 8.57%,LatentSkill 仍保持 38.6%。Skill 不以明文出现在 prompt / 请求日志中,降低策略被抽取和复制的风险。

LatentSkill 鲁棒与安全
文本扰动与 Prompt 攻击下的稳定性对比

LatentSkill 的训练分两阶段:先用 17 万条开源 Skill 文档预训练 Compiler(text→adapter 映射),再在具体任务上微调。

LatentSkill 两阶段训练
LatentSkill 两阶段训练

LatentSkill 对 Agent 平台意味着什么?

  • 更低成本——长程任务不再每步重复读取 Skill text,减少隐性 Prefill 开销
  • 更低暴露——Skill 不以明文出现在 prompt / 日志,降低策略被抽取风险
  • 更好治理——Skill 变成可插拔、可缩放、可组合的 adapter,便于版本管理、灰度与 A/B
  • 新产品形态——从交付 markdown 手册(分发≈暴露)到交付 LoRA adapter(可授权、可计费、可撤回)
LatentSkill 平台意义
Skill 从文档资产升级为可授权的软件模块
Harness 框架给了我们一个审视内部体系的透镜:算子生成流水线本质上就是一个 Harness——工具链、验证器、性能分析器是 Protocol/Tool,优化经验是 Skill,历史编译记录是 Memory。未来可探索的方向是把高频算子优化 Skill 通过 LatentSkill 思路编译为 adapter,降低每次优化的推理成本。

对我们的启示

结合三场分享与团队现状(GPU 算子研发 + 内部 Skill 代码仓),我的判断如下。

行动方向

  1. Skill 内化路径——在现有算子生成/优化/适配 Skill 基础上,建立「执行轨迹归档 → 成功模式提取 → Skill 版本迭代」的闭环,参考 GA 的 L3/L4 分层与 SkillClaw 的治理流程
  2. 环境反馈驱动进化——把编译结果、性能 profile、精度验证作为进化信号,替代纯人工 review,让 Skill 在使用中自动优胜劣汰
  3. 关注 LatentSkill 范式——对高频、结构化的算子优化 Skill,评估从文本注入到权重编译的可行性,降低长链路优化的 Token 与延迟成本

核心判断

  1. 自进化不是噱头,而是架构选择——主路径从「工程设计」转向「有机生长」,分层记忆 + 轨迹归档 + 本地内化构成完整闭环;但并非完全不规划——早期规划设计如同 RL 自进化前的监督学习,承担冷启动角色,先播下种子、搭好骨架,再在使用中放手演化。算子优化天然适合这种「先引导、后越用越强」的模式
  2. Skill 的竞争力在「群体层」——单体 Agent 的经验停留在个人,真正的壁垒是跨 Agent、跨 Session 的 Skill 沉淀、治理与分发;我们的共享 Skill 仓已具备基础,可沿进化信号与验证闭环方向持续深化
  3. 模型之外的空间被严重低估——Harness(Memory / Skill / Protocol / 调度)是场景适配的主战场;Textual Skill 只是起点,Latent Skill 编译或是降本增效的下一跳