Skills Radar[1] 又更新了。
10项新技术落地,总量拉到 123项。这10项的分布很有意思:4项扎在召回,2项补评测的安全漏洞,2项给生成打开了全新的知识来源,1项在优化线上把递归推到了下一层,1项在管理线上铺了21.7万条技能的地基。
没有哪一项是"把老benchmark改个名再跑一遍"的重复造轮子。每一篇都在自己的线上开了一条新分岔。
拆开聊五条线。

召回线在重写:四个人从四个方向,同时说"语义匹配不够了"
召回是这次更新最密集的战场。四篇论文几乎同时出手,但切入角度完全不同。

UCOB问了一个更底层的问题:技能召回之后,Agent该不该信这个技能?它的答案是信用感知双向自蒸馏。同一个任务跑两路:带技能的条件化视图和不带技能的无技能视图,两组轨迹都在环境里真跑,然后比实际回报。技能帮上忙了,正向蒸馏把策略内化到无技能视图;技能产生误导了,反向蒸馏用无技能的行为纠正技能视图。不是默认"技能总是好的",而是让环境回报做裁判。Qwen3-1.7B 上,ALFWorld 89.1%(+23.5pp),WebShop 79.7%(+18.0pp)。这回答了召回之后的"下一步",不是选出来就完了,选出来之后还得判断该不该信。
Skill Collision(微软)面对的问题更工程化:技能数量膨胀到几十个以后,技能描述之间的语义重叠会导致路由决策混乱。他们从生产环境中发现,这个问题的解法不需要 fancy 的算法,LLM单次重写描述,就够了。把误路由和漏路由的案例喂给LLM,让它分析失败模式然后改写描述,一次完成。人工调优一个技能要 120 分钟,自动化降到 3.8 分钟,提速 32 倍,路由 F1 只比人工基线低 0.12%。最有价值的其实不是效率提升,而是两个诊断指标:iter-0 训练 F1 低于 65% 的技能才是描述优化的主战场(+6.27%);训练/验证 F1 差距大的说明是技能功能本身重叠,改描述没用,得重构架构。区分真假碰撞,比盲目优化重要一百倍。
SkillComposer(浙大 + 通义)盯上了另一个空白:选出 3 个技能,第一个做什么、第二个做什么、它们的顺序对不对?它把选哪些、选几个、按什么顺序这三个子问题合并成一次自回归解码,一个仅 390 万参数的微型Transformer,输出{1,...,196} ∪ {STOP},STOP的位置决定数量,索引顺序决定执行顺序。TF-IDF做检索先验、稠密向量做编码,各取所长。仅用合成数据训练,分布外Set F1 62.9%,领先全量微调基线 19.3 个百分点。极低推理成本(1.03M token),技能组合不再是大模型的专属能力。
SkillReranker把整个路由器的坐标系换掉了。以前是"任务 → 相似度排序 → 截断Top-K",K是人工预设的。它问:凭什么?先让LLM把任务拆成有序子任务序列,每条技能提取前提状态和完成状态,用交叉编码器做图匹配。然后分析图的In/Out/Cross三元分布,自动发现任务的自然阶段边界,每阶段只选一个最适配的技能。简单任务 1-2 个,复杂任务 3-4 个。技能数量不由你定,由任务结构定。
四篇论文,四种完全不同的攻击角度。召回不再是"这个query跟哪个技能最像"。它在变成一个有信用评估、有碰撞诊断、有组合预测、有自适应数量的完整决策系统。
评测在堵漏洞:单技能安全不够,组合才是真正的雷区
上半年最让人不安的是技能评测和安全领域几乎真空。这两篇同时在填坑,而且都指向同一个方向:只看单个技能不够。

SkillFuzz 发现了所有技能市场都漏掉的盲区:审核只检查单个技能,不检查技能组合。两个技能单独审核都通过,组合激活后,Agent的计划悄悄偏了,本来该下载文件的,现在顺便读了个不该读的配置文件,而且计划里写得明明白白。它用MCTS在技能激活空间上做模糊搜索,把"计划漂移"当差分信号:同一任务在有/无某技能组合条件下生成计划,差异显著即说明组合引入了额外意图。只在计划层面运行,不需要部署真实执行环境。从 10 个任务中发现 1000+ 隐式意图,Docker沙箱执行验证确认率超过 80%。只探索了 39.7% 的成对交互空间,但严重意图比例达到 77%——定向搜索的效率远超随机撒网。跨 8 个模型确认率几乎一致(80.5%-81.0%),说明这信号是结构性的,不是某个模型的偏置。
SkillCoach挑战了评测领域最根深蒂固的一个默认假设:"任务做对了"就等于"技能用对了"。它的答案是自演化评分表——把技能使用拆成选择、遵循、组合、反思四个过程维度,独立于外部验证器。Agent可以碰巧做对但不该选的那个技能(伪成功轨迹),验证器看不出,评分表看得出。评分表从gold技能文档自动生成初始版本,然后通过真实rollout暴露的缺陷驱动迭代补丁,幻觉率从 2.00 降到 0.00,轨迹筛选一致性从 82 提到 96。用评分表筛选 SFT 数据,模型最终准确率从结果筛选的 18.0% 提升到 32.0%。"做对了"和"用对了"是两回事,把它俩混为一谈,你就会在训练数据里埋下一堆伪正例。
生成在开新矿源:别光啃自己的轨迹了
之前生成线的默认范式是"从Agent自己跑的轨迹里提炼技能"。RESOURCE2SKILL和SkillFab 同时说:太浪费了。外部世界的知识金矿,你连第一锹都还没挖。

RESOURCE2SKILL(微软)把技能生成做成了多模态知识蒸馏。输入不是Agent跑过的路,而是四个完全不同的信息源:教学视频捕获操作顺序,代码仓库提供可调用模式,文章解释概念和场景,参考作品提供风格基准。四源素材经五道质量门控,拼成文本/视觉/代码三字段互补的结构化条目。层级Wiki树做分类约束,BM25关键词初筛 + LLM子集精选,选中的技能代码通过 MCP 直接执行不翻译。7 个创意软件领域、4 个模型后端,平均 +11.9 个百分点。一个从未见过的教学视频,变成了 Agent 可以直接调用的可执行技能。
SkillFab(skillfab.ai)补的是另一个坑。技能怎么生产、怎么发布、谁审查、怎么追溯?它把软件工程的协作基础设施:issue追踪、Git证据、审查门禁、注册表发布,适配到Agent技能的粒度上。两条原则:需求先行(能力缺口可以先于代码存在被记录为issue),复用先行(Agent接到任务先查注册表,已有则复用,失败才走开发流程)。最关键的设计是控制平面和证据平面分离,MCP调用创建issue/提交审查/发布技能,Git推送提供实际文件内容。两边解耦,一边失败不污染另一边。已部署在skillfab.ai,外部优化器可直接以 PR 形式提交优化后的技能。
优化在递归:连"怎么改"这件事本身,都开始被改了
优化这条线已经够卷了。梯度类比、信用分配、分层搜索,大家都在找更好的改技能的方法。MetaSkill-Evolve把这件事的递归层级往前推了一步。

它搞了两个时钟。快时钟做正常的任务技能进化:选分支、诊断失败、跨分支拉取修正案例、产出候选编辑、验证集评出增量。慢时钟每隔 H 次触发——把快时钟近期的全部诊断、编辑方案、成功率和生产力打包成合成元故障trace,跑同一套五Agent流水线,目标文件从任务技能换成元技能本身。Analyzer(怎么诊断)、Proposer(怎么提案)、Allocator(生几个子代)、Retriever(怎么跨分支分享)、Evolver(怎么写回文件)——五个组件,全在慢时钟里被持续优化。
快时钟在进化技能。慢时钟在进化"进化技能的方法"。所有Agent共享一个冻结的Gemma-4 31B,基座不训练,零微调。OfficeQA +23.54,SealQA +16.09。三重增益全部来自文本演化。
"怎么改"本身成了可演化的对象。这层递归打开之后下一步会走到哪,说实话没答案。但方向已经指出来了。
管理在铺地基:21.7 万条技能的可追溯基础设施
SkillCenter做的事看起来不那么"聪明",但可能是这批里最关键的一张牌。
它收录了216,938 条结构化技能,覆盖 24 个领域。114,565 条来自SkillGate自动化流水线,从学术论文、GitHub、技术网站、Stack Overflow提取;102,373 条来自社区集成。每条技能可追溯到源文档精确引文位置,这是核心差异点:跟普通RAG文档片段不一样,你知道这条技能是"从这篇paper第三章第三段来的",不是LLM编的。
核心设计是迭代来源校准:LLM生成每条技能主张时,必须映射到源文档的引用位置,找不到对应原文就修改或删除。GPT-5.2 三维度质量打分(清晰度、准确性、可操作性),流水线平均 3.91/5。SQLite FTS5离线分发,bundle-install --auto自动检测项目类型并加载对应领域包。21.7万不是终点,是起点。大规模技能库的工程基础设施,提取、去重、校准、索引、按需分发,第一次被系统化地做成了可复用的流水线。
最后说两句
10项新技术,不靠数量取胜。召回线四个人从四个方向同时进攻同一个命题:语义匹配不够了。评测线两篇同时在说:只看单个技能看不到真正的风险。生成线两篇打开了两个全新矿源:外部多媒体知识和生产协作流水线。MetaSkill-Evolve开启了新的递归深度。SkillCenter在铺最不起眼但可能最持久的基础设施。
123项总覆盖。横跨60+家机构。生成到管理,六条线没有一条在减速。
我们做Skills Radar的理由没变过:这领域变太快,不看tracker会漏掉一半。每项技术我们配的不是标题搬运:是一句话说清楚它在做什么、怎么做的、哪儿强哪儿弱、论文在哪儿。不看碎片,看地图。
