Hark发布Handoff:一款低价高性能的计算机使用代理
AI初创公司Hark推出Handoff——号称全球最强网络导航代理,支持端到端执行订餐、订票、招聘等任务;在OM2W基准测试中得分97.7,定价仅为竞品十分之一,但对比未涵盖GPT-5.6、Opus 5等最新模型。

Hark这家神秘的 人工智能初创公司成立于今年早些时候 由连续创业者兼机器人专家Brett Adcock创办, 今日宣布推出Handoff——一款“计算机使用代理”(CUA),该公司称其为全球性能最强的网络导航代理之一,可代表用户自主、端到端地在开放网络上执行任务——例如在DoorDash上下单订餐、在United和Delta上预订航班,或在LinkedIn上向求职候选人发送消息。
公众今日起可在 hark.com注册,计划于本月晚些时候作为Hark软件平台初始发布的一部分正式上线。
该公司表示,Handoff在第三方基准测试 Online-Mind2Web(OM2W)中创下有史以来最高分;该基准测试设有经人工评估的网络代理排行榜,Handoff得分为97.7,而OpenAI的GPT 5.4为92.8,Anthropic的Claude Opus 4.8为84.1,Google的Gemini 2.5 Pro为69。

Hark Handoff基准对比图表。图片来源:Hark
Hark还表示,其模型服务价格低于竞品前沿模型每token价格的十分之一——输入token价格为每百万0.18美元,输出token价格为每百万2.37美元,而GPT 5.5分别为5美元和30美元;单次交互模型延迟为0.8秒。

Hark Handoff定价对比图表。图片来源:Hark
每次请求,Handoff均会启动一台专用虚拟计算机,配备独立浏览器、文件系统及终端;用户可连接现有账户,使代理能够登录并使用其保存的地址、付款方式及历史记录执行操作。
Hark的研究发现,尽管人们每天75%的屏幕时间都花在浏览器中,但公开提供API的网站不足千分之一,这使得AI代理难以接管相关工作负载。
在一段约四分钟的制作精良的公告视频中——该视频已发布于 YouTube 及社交媒体平台——Adcock坐在一处空旷的仓库空间内(该空间亦隐喻公司当前的建设阶段),口头向Hark发出指令(“让我们让这个地方活跃一点……来点玫瑰,或许再加些樱花”),随后视频展示Handoff导航至一家花店网站完成下单;Adcock同步解说称,与典型聊天机器人不同,Handoff“始终处于运行状态,持续循环”,并表示他目前已将Handoff用于“全部端到端招聘工作”。在Hark的公告 博客文章中,更多演示以实时及5倍速形式呈现。
但关于Handoff仍存在若干重大未解问题,尤其对潜在企业客户及用户而言。
高分基准测试……但对比对象为上一代模型
值得注意的是,Hark向VentureBeat提供的Handoff AI代理基准测试对比数据,其参照对象为GPT 5.5、GPT 5.4、Opus 4.8及Gemini 2.5 Pro——即上一代前沿模型。
当前领先者——OpenAI的GPT-5.6与Anthropic的Opus 5——均未列入对比;同样缺席的还有DeepSeek V4、Kimi K3及Qwen3.8-Max等强劲开源计算机使用竞争者。
这些新模型尚未公布Online-Mind2Web测试结果,且尚无第三方将其结果发布至 该基准测试的公开排行榜 ——这意味着Hark所宣称的“有史以来最高分”目前无法与最强可用系统进行验证。
这一遗漏尤为显著,因为最新前沿模型的最大进步恰恰体现在计算机使用能力上:在另一项覆盖完整计算机控制的关联基准测试 OSWorld 2.0中,Anthropic的Opus 5得分为约70.6%,而Hark选定的对比对象Opus 4.8仅为55.7%。
延迟对比亦存在类似注意事项:Hark所引用的GPT 5.5(6.8秒/次)与Opus 4.8(6秒/次)的单次交互延迟数据,系由Hark在其自有测试框架中测得,且竞品模型均被设定为其最高——亦即最慢——推理级别;目前尚无独立延迟测量数据可供比对。
VentureBeat询问Hark是否计划发布针对这些新模型的对比数据,该公司未予明确说明。
即便在Hark自行选定的对比范围内,“最佳”表述亦附带星号标注:在Hark自身结果表格所列三项基准测试之一的WebTailBench v2中,GPT 5.5得分为72.3,而Handoff为68.6。
三项基准测试中的两项(WebTailBench及一项未具名内部评估)亦在Hark自有测试框架内运行,通过Hark内部大语言模型裁判计算通过率——此类条件由该公司自主控制。
Hark的定价优势则清晰得多:Anthropic新款Opus 5与其前代产品同为每百万输入token 5美元、每百万输出token 25美元的标价,因此Handoff约十倍的成本节约优势即使面对当前前沿模型亦能成立——前提是其基准测试表现同样成立。
训练与文件访问
Hark的研究预览描述了一条看似合理的流程——据今日公告前向VentureBeat分享的材料,该流程包括监督微调,继而采用GRPO算法进行异步强化学习——但该公司承认迄今仅完成后训练阶段,预训练“计划于今年晚些时候开展”。
这意味着Handoff构建于Hark未自行训练的基础模型之上。当被问及该基础模型具体为何,以及Handoff训练所用数据中专有数据与开源数据的具体配比时,Hark尚未予以明确说明。
对企业用户而言另一重大疑问是:谁有权访问专用虚拟计算机及其上创建的文件?
Hark一位发言人表示:“安全与隐私是首要关注点,但本次仅为技术预览”,并补充称公司将在产品于夏末正式上市时披露更多信息。
Adcock创立Hark前的职业履历
Hark是Adcock创办的第四家公司。他此前曾联合创办人才市场平台Vettery(于2018年以约1亿美元售出)、 空中出租车制造商Archer Aviation, 以及 人形机器人独角兽公司Figure AI。
Hark公司筹集了一轮 7亿美元的A轮融资,融资时间为2026年5月,估值达60亿美元 ——由Parkway Venture Capital领投,Nvidia、AMD、Intel Capital、Qualcomm Ventures、Salesforce Ventures及ARK Invest参与投资。
阿德科克(Adcock)以自有资金向该公司注资1亿美元,一名发言人证实,他目前仍同时担任Figure和Hark两家公司的创始人兼首席执行官。
当被问及这两家公司如何互动时,该发言人表示,Hark公司的“模型正在Figure机器人上进行训练”,但阿德科克并无将二者合并的计划。
阿德科克的宣传风格招致了质疑者。2025年4月,《财富》(Fortune)记者 杰森·德尔雷(Jason Del Rey)报道称,Figure广为宣传的与宝马(BMW)的合作关系 远比阿德科克公开宣称的机器人“车队”执行“端到端运营”要低调得多:宝马发言人史蒂夫·威尔逊(Steve Wilson)表示,仅有一台Figure机器人在非生产时段练习拾取零部件。
但该合作已取得进展,截至2026年6月, 宝马表示,Figure 02机器人 在为期10个月的周期内支持了超过3万辆宝马X3车型的生产,并且下一代Figure 03机器人已在该工厂部署,承担物流环节中的零部件排序任务。
在社交网络X上, 阿德科克称该报道为“歪曲事实和彻头彻尾的谎言”, 并威胁提起诽谤诉讼。两个月后, TechCrunch报道称,阿德科克缺席了一场承诺的现场演示, 并在一场科技大会上回避了有关宝马交易的台上提问。
这些情况并不意味着Handoff的数据有误。该智能体可能确实极为出色,而其定价——若能维持——将低于所有主要实验室。
JOTO 企业落地观察
- 对企业部署而言,Handoff采用专用虚拟机+账户直连模式,虽提升操作真实性,但也带来企业IT治理新挑战:虚拟机生命周期管理、文件归属权与审计日志缺失,将迫使客户在安全策略与自动化效率间重新权衡。
- 对智能体工程而言,Hark承认Handoff尚未完成预训练,仅依赖第三方基础模型+监督微调+GRPO强化学习,说明当前CUA开发正从‘全栈自研’转向‘高效后训练+架构创新’路径,凸显工具链与沙箱环境比基座模型更关键。
- 对AI安全治理而言,Handoff每次请求启动独立虚拟机并访问用户真实账户凭证,却未明确说明数据留存策略与隔离强度,暴露了数字员工类应用在隐私合规(如GDPR/《个人信息保护法》)落地中的典型缺口:动态计算环境下的最小权限与可撤销授权机制尚无标准实践。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们

