相关文章
6836 篇高质量内容月之暗面的 Kimi Code 和 Kimi Work 正式接入 CloudBase
月之暗面旗下 Kimi Code(CLI 客户端)与 Kimi Work(桌面 Agent)正式接入腾讯 CloudBase,通过统一插件支持 29 个技能与 1 个 MCP 服务,实现自然语言操作云资源。插件基于 Open Plugin Spec,适配双端环境变量,无需切换浏览器即可完成数据库建表、云函数部署等操作。
DeepSeek-V4.1-Flash发布:0.003美元/百万缓存输入,专为智能体长上下文优化
DeepSeek推出V4.1-Flash模型,5520亿参数MoE架构,原生视觉支持,100万token上下文;非高峰时段缓存输入仅0.003美元/百万token,显著优于GPT-5.6 Sol与Claude Opus 5,但对硬件部署要求大幅提升。
Harness Inspector:让 Agent 交付过程可观察、可检查、可追溯
Harness Inspector 是一个本地、只读的 Agent 交付工作台,将用户需求(Intent)、Agent Session(Process)和 Git Commit(Output)统一呈现,支持 Workbench(看关系)、Trace(看结构)、Replay(看顺序)三种观察模式,旨在解决 Agent 行为不可追溯、经验难沉淀的问题。
从钉群提问到任务交付:团队级 Agent 基础设施全链路实践
阿里云自研研发协作平台Domino,从钉群提问到全链路任务交付,揭秘团队级Agent基础设施实践与演进。核心内容:1. Domino平台从单一工具到团队级Agent系统的演进历程2. 钉群提问场景下Agent面临的核心问题与解决方向3. 分层Agent体系(ConsoleAgent+SandboxAgent)的能力与实践
基于阿里云 AgentLoop 的 DeepSeek Harness 评测实践
本文基于阿里云AgentLoop平台,对DeepSeek开源的Agent运行框架Harness开展工程化评测,采用terminal-bench 2.1的10任务子集,以容器终态为判定依据,构建任务完成度、红线规则合规性与执行过程可靠性三个正交评估维度,全部通过规则化脚本实现,规避LLM打分偏差,验证了Harness架构中Session Log事件溯源、极简模式可控性及插件化可观测性的评测适配价值。
Agent 观测与优化开发者摸底报告
Agent生产落地遇难题?700+企业调研揭示观测、评估、优化基建薄弱痛点,助你建立可优化工程闭环。 核心内容: 1. Agent生产落地现状:需求强烈但基建薄弱、认知体系化不足 2. 观测与评估核心瓶颈:轨迹观测工具缺乏、评估依赖人工经验 3. 优化闭环与审计合规:闭环未形成但需求迫切,审计落地能力待提升
Google 给 AI 曝光单独记账:企业该为 GEO 的什么买单?
Google Search Console 新增生成式 AI 表现报告,可单独追踪网站在 AI Overviews 等功能中的曝光,但无法直接关联转化与收入。微软强化引用语境分析,Adobe 整合商品目录与内容优化,共同推动企业从「被提及」走向「被准确理解」。文章指出:GEO 预算需拆解为监测、诊断、信息改进与经营评估四类能力,每类交付物与不可推导结论均需明确界定。
刚刚,Codex 把"压缩"换成了"记忆"
Codex CLI 将记忆系统从有损的 compaction(压缩)机制,升级为 token budget(token 预算)+ 硬性上下文切换架构。模型可主动感知剩余 token、自主触发新窗口,并通过 history 和 notes 工具完整保留与检索历史,实现从被动执行到主动管理、从失忆到记忆的设计转变。
从数据流到 AI 上下文: IBM Confluent 面向 AI 场景的能力演进
本文梳理 IBM Confluent 如何从实时数据流平台演进为面向 AI 的实时上下文与行动底座。核心在于支撑事件驱动 AI 模式,通过感知(内置 ML 函数)、供数(MCP 实时上下文引擎)和行动(Streaming Agents)三层能力,在信用卡欺诈检测等场景中实现 DAY 1 实时处置与 DAY 2 持续优化闭环。
从一次 LLM 调用到完整 Harness,Agent 到底经历了什么?
文章系统梳理 Agent 架构演进路径:从单次 LLM 调用出发,依次叠加上下文装配、ReAct 循环、结构化工具调用、分层记忆系统,最终形成包含会话管理、权限控制、沙箱隔离、事件追踪与多客户端支持的 Agent Harness 层。通过 Pi、OpenCode、Codex 三个典型项目对比,揭示不同 Harness 在极简性、状态工程与安全执行上的设计取舍。
DeepSeek Harness 的 Agent 运行时设计
DeepSeek Harness 是一个面向长期运行 Agent 的可组合运行时,通过插件生命周期、追加式事件日志和能力接缝统一托管模型、工具、会话与外部协议。其核心设计包括:明确区分 SDK 与运行时边界;以插件为组成单位并支持动态卸载;通过 Profile/Patch 实现可复现的 Agent 配置;用 Turn/Step 划分可暂停、可追溯的执行单元;以 Session Event Log 作为模型上下文唯一事实来源;将能力接口、实现与安全策略解耦为三层 Capability Seam;Web/SDK/ACP 均为同一运行时的投影。
刚刚,OpenAI公开研发内幕:递归自我改进只会局限在少数实验室
OpenAI公开研发内幕:智能体系统重塑AI研发,人类1工作日被AI智能体顶至3.1倍,2028年目标全自动研究员。 核心内容: 1. 智能体重塑研究员工作(工作量、费用、任务类型扩散) 2. 研发产出与任务成功率提升(实验量创新高,复杂任务依赖人类干预) 3. 人类与智能体协作模式(人类掌握决策权,智能体承担底层工作)
Behavior Spec 完整解读:用行为规范监督长程 Agent
Behavior Spec 是一种独立、可版本化的行为标准,用于定义长程 Agent 在完整任务轨迹中应展现的关键行为(如一手来源核验、高风险决策升级),并支持 true/false/NA 三值审阅。它区别于 Prompt 和 Eval,聚焦过程可信性而非结果正确性,适用于税务、法务、财务等高合规要求场景。
德勤扩招FDE,成立开放模型工程业务
德勤全球宣布成立开放模型工程业务,聚焦混合模型架构与FDE现场交付模式。该业务强调模型中立性、Token成本管理及AI运营能力,将FDE定位为串起业务场景、Agent搭建与多模型调度的核心节点,并提出AI原生团队的业务人才、平台人才、FDE人才三角结构。
阿里开源 TTS 新一代:CosyVoice 3.0,0.5B 参数吊打一众大模型
2025 年 12 月,阿里 FunAudioLLM 团队发布 CosyVoice 3.0:0.5B 参数、支持 9 种语言与 18 种以上中文方言、零样本声音克隆、延迟低至 150ms,开源协议为 Apache 2.0。其 RL 版本中文 CER 降至 0.81%,说话人相似度达 77.4%,在多项指标上超越参数量更大的开源及闭源竞品。
Google Teamwork:多个 Agent,不等于一支团队
Google Antigravity Teamwork 是一个面向复杂长期任务的多 Agent 编排框架,通过明确分工、结构化产物交接和独立验证机制,解决多 Agent 系统易陷入集体错误、自我验证失真、状态混乱等核心问题。其关键创新在于将任务责任拆分为组织、执行、证明三类,并依赖外部可审计的状态记录而非长对话上下文。
从 Vibe Coding 到 Harness Engineering: JDK 升级中可控演进的 AI 工程实践
AI Coding擅长新功能开发,但JDK升级等维护性工程需“改得对”。本文结合实践,分享Harness Engineering让AI稳定完成系统升级的工程化思路。核心内容: 1. AI Coding在新功能开发与维护性工程中的差异 2. JDK升级作为维护性工程的典型挑战(依赖、配置、运行期约束) 3. Harness Engineering实现AI可控演进的工程化实践
AI记忆开始携号转网,谁握着用户的记忆谁就握着用户
Anthropic与谷歌在2024年3月先后开放AI助手记忆导入导出功能,标志AI记忆迁移能力落地。当前迁移依赖人工提示词复制,尚无统一格式或标准接口。记忆作为用户长期调教形成的个性化资产,正成为模型之外的关键护城河。行业已出现Mem0、记忆张量、MemoraX AI等专注记忆层的初创公司,大厂亦将记忆能力纳入基础设施。
使用 Gemini 3.5 Transcribe 进行AI智能转录
Google 正式推出 Gemini 3.5 Transcribe,专为智能语音交互设计的高精度语音转文本模型。支持实时流式与预录制音频两种 API 模式,具备智能转录、函数调用、自定义词汇、85+语言识别及多说话人标注能力。实测词错误率低至 2.6%(非流式)和 4.0%(流式),显著优于前代 Chirp 3 模型。
怎么猛蹬GPT-6 Astra? 官方指南来了,手把手保姆级教程
本文整理 OpenAI 官方发布的 GPT-6 Astra 使用指南,涵盖模型核心能力(异步工具调用、中途引导、推理力度动态调整等)、提示词最佳实践(主动推进、指令遵循、去AI味、子代理委派、测试校准)及迁移快速入门(API 切换、参数更新、配置适配)。所有内容均基于官方文档原文,不含主观解读或营销话术。



















