开发者抱怨OpenAI与Anthropic安全机制误判常规开发任务,拖慢AI编程进程
多位航空航天、机器人及网络安全领域开发者反映,OpenAI GPT-6系列与Anthropic Claude/Fable模型频繁将合法开发请求(如卫星仿真、机械臂UI、开源代码审计)误标为高风险,导致响应拒绝或中断。企业被迫转向开源模型或调整工作流,暴露当前闭源模型安全防护与工程实践间的深层张力。

OpenAI在周二的开发者大会主题演讲中着重强调了速度与成本节约。而在会场走廊和周边商品排队区,开发者们则更想讨论他们因绕过模型安全防护措施而损失的时间。
开发者向VentureBeat表示,OpenAI和Anthropic的安全防护机制正将常规的航空航天、机器人及安全领域工作标记为高风险,从而耗费他们的时间,并扰乱原本正常的开发流程。一些开发者描述称,当拒绝响应变得难以规避时,他们会选择放弃当前对话,或将特定任务转移到其他模型上执行。
AI智能体已深度嵌入日常开发工作中。JetBrains于2026年开展的面向逾15,000名专业开发者的《开发者生态系统调查》发现 90%的开发者在工作中至少每周使用一次AI编程智能体,其中包括68%每日均使用AI编程智能体的开发者。
这些开发者的反馈出现之际,正值OpenAI试图减少无害请求被拒现象,同时加强对更强大模型的安全防护。在发布会上,OpenAI推出了 GPT-6.1 Sol,该公司称该模型在编程与计算机操作任务上的性能已接近其更强大的GPT-6 Astra模型,但标准代币价格仅为Astra的五分之一。
OpenAI还表示,其GPT-6系列模型比早期模型更少拒绝无害请求;且 该模型的系统卡 指出,OpenAI将Sol本身列为网络安全“关键级(Critical)”,并采用与GPT-6 Astra相同的防护堆栈。GPT-6 Astra的系统卡称,Astra是OpenAI“根据我们的准备就绪框架(Preparedness Framework),首个达到网络安全‘关键级’能力的模型”。OpenAI表示,借助恰当的工具与访问权限,该模型可在无需人类逐步指导的情况下,自主发现并利用受严密保护系统中的未知漏洞。此外,OpenAI还因安全顾虑取消了GPT-6.1 Astra的发布 ,据《华尔街日报》报道。 OpenAI向VentureBeat承认,其安全防护措施可能干扰合法工作。该公司表示,GPT-6 Astra与GPT-6.1 Sol拒绝无害请求的概率低于GPT-5系列模型,但额外的安全检查仍可能“减慢、暂停或中止合法工作”,包括防御性网络安全工作。OpenAI称,其正持续优化安全防护措施,以减少不必要的中断。随着模型成本下降,开发者表示,拒绝响应可能带来另一种代价:时间损失。
一颗并不存在的卫星
亚历杭德罗·卡拉斯科(Alejandro Carrasco)
是麻省理工学院(MIT)航空与航天系二年级硕士研究生,其研究领域——软件与太空——有时会触发模型安全防护机制。他曾与斯坦福大学某实验室合作,将大语言模型(LLM)智能体部署于模拟航天器的控制中,测试语言模型能否在执行飞行任务方面超越强化学习算法。
卡拉斯科表示,他尚未遭遇 outright 拒绝(即明确拒绝)。相反,他的请求有时会被视为可疑。“由于我在航天部门工作,模型有时会认为我正在从事军事相关事务,”卡拉斯科说,“我正在处理一颗卫星,但它无法识别这是一颗模拟卫星。”
他表示,模型有时会将他的请求标记为涉及敏感数据或国防安全许可,尽管他本人并无此类许可。当被问及前沿实验室时,他特别点名Anthropic:“Claude的防护更为激进。”
卡拉斯科认为对话历史会加剧这一问题。一旦模型开始将其工作视为可疑,他便很难将对话拉回正轨。“一旦我发现我的对话已走到无可挽回的地步,或即将得出例如拒绝之类的结论,我就会直接切换模型,”他说。
机械臂与SSH会话
从事机器人项目开发的马丁·肯卡(Martin Kemka)表示,他所遇到的阻碍出现在工作的常规环节中。
“我在开展任何机器人项目时都遭遇大量拦截,即便是非常良性的项目,”肯卡说,“比如为机械臂创建用户界面,或通过SSH登录另一台机器,我都会收到大量拒绝响应。”
卡拉斯科曾使用过开源SO-101机械臂及优傲机器人(Universal Robots)UR5机械臂,他表示触发因素似乎是访问权限。一旦他要求模型访问真实设备参数,便会遭遇更多限制。几个月前,他称某款模型并未直接拒绝,而是要求他明确以名称形式声明自己授权该模型访问其个人摄像头与传感器。
肯卡报告称,在MicroVerse模拟器中使用Astra未遇困难,他在该模拟器中已训练虚拟机器人完成平衡、相扑摔跤及潜行绕过守卫等任务。他表示,当要求模型操作物理硬件或连接另一台机器时,拒绝响应才会出现。
因拒绝响应而取消订阅
DAIR.AI联合创始人、《提示工程指南》(Prompt Engineering Guide)作者埃尔维斯·萨拉维亚(Elvis Saravia)表示,他严肃对待该技术带来的风险。
“我是一名构建者,但也思考安全性问题,”他说,“我也思考你可能造成的损害。”
即便如此,他仍将拒绝响应称为像他这样的技术用户所面临的“一大难题”。“实际上,这种体验令人相当沮丧,”他说。他表示,他不喜欢看到安全防护措施阻碍人们构建自己想要的东西。 萨拉维亚称,他所描述的“极为明显”的拒绝响应最终导致他取消了Anthropic的订阅服务。他目前使用GPT-6 Astra,称这是他所用过的前沿模型中防护最不激进的一款。 当安全工作被标记 罗汉·巴尔孔德卡尔(Rohan Balkondekar)的工作时间在Xsolla与他联合创立的增长代理公司VibeGrow之间分配。其团队主要使用OpenAI的Codex与Anthropic的Claude进行编码,他表示,与网络安全相关的请求尤其容易触发拒绝响应。
“它们讨厌‘cyber’这个词,”巴尔孔德卡尔说,“只要你说出‘cybersecurity’(网络安全),它们就直接一口回绝:‘不行。’”
他表示,其团队需要审查的大部分代码来自开源贡献者,并补充称,审查第三方代码是否存在漏洞正是触发防护机制的任务之一。他说,该问题在最新一代前沿模型发布后愈发突出,特别指向Anthropic的Fable系列模型与OpenAI的GPT-6系列。
OpenAI提到了Daybreak Access
当安全相关工作被标记时
罗汉·巴尔孔德卡尔(Rohan Balkondekar) 在 Xsolla 和 VibeGrow之间分配时间,后者是他联合创办的一家增长代理机构。他的团队主要使用 OpenAI 的 Codex 和 Anthropic 的 Claude 进行编码,他表示,与网络安全相关的请求尤其容易触发模型拒绝响应。
‘他们讨厌‘cyber’这个词,’巴尔孔德卡尔说,‘只要你一提到 cybersecurity,它们就直接断然拒绝:‘不行。’’
他表示,其团队需要审核的大部分代码来自开源贡献者,而审查第三方代码是否存在漏洞正是触发防护机制的任务之一。他指出,随着最新一代前沿模型的发布,这一问题变得更加突出,并以Anthropic的Fable模型和OpenAI的GPT-6系列为例。
OpenAI提到了Daybreak Access,即面向合格企业客户和网络安全从业者的可信访问计划。该公司表示,该计划支持经授权的防御性工作,包括安全代码审查、漏洞优先级排序、事件响应和恶意软件分析。
Anthropic 已承认其防护机制存在误报问题。其 Fable 模型 内置防护机制,可将被标记的网络安全和生物学相关查询重定向至能力较弱的模型。Fable 5 于6月发布后, 开发者纷纷抱怨 其安全系统正在拦截无害提示词,Anthropic 表示其在权衡取舍上做出了错误决定。 本月发布的 Fable 5.1 版本中,Anthropic 表示,其网络安全防护机制现已允许在源代码中开展漏洞发现工作,并应在每次 Claude Code 会话中将干预次数减少约60%,但渗透测试、漏洞利用生成以及部分基于二进制文件的漏洞扫描仍会被路由至非 Fable 模型。
截至本文发表时,Anthropic 未就置评请求作出回应。
开源模型的变通方案
当闭源模型拒绝执行任务时,Balkondekar 的团队转而采用开源模型,包括月之暗面(Moonshot AI)的 Kimi 模型。Balkondekar 表示,成本因素早已促使他们展开实验,而模型拒绝执行任务又为他们使用开源模型提供了另一重理由。
Carrasco 使用阿里巴巴的 Qwen 模型开展研究,并指出许多工作流更需要一个运行速度快、体积小且可在本地部署的模型,而非前沿模型,尤其当开源社区中已有人针对特定领域对模型完成微调时。Kemka 提到了 Apfel 应用程序,该应用将苹果公司在最新版 macOS 中预装的语言模型作为本地 API 暴露出来。
对 Balkondekar 而言,开源模型是闭源模型无法满足其团队需求时的备用方案。“当 Anthropic 和 OpenAI 等闭源模型拒绝执行某项任务时,我们确实会使用开源模型来完成这类工作,”Balkondekar 表示,“因为总得有人去做这件事。没人能坐下来逐行审阅全部内容。”
JOTO 企业落地观察
- 对企业部署而言,OpenAI Daybreak Access与Anthropic Fable的分级防护策略表明:高权限安全能力正从通用API向白名单制可信通道收敛,企业若需开展防御性网络安全工作(如漏洞扫描),必须主动申请资质认证,否则将面临持续性工具链断裂。
- 对智能体工程而言,卡拉斯科与肯卡的案例揭示:当LLM智能体被嵌入航天器控制、机器人SSH操作等真实系统交互场景时,模型对‘访问权限’‘设备参数’等关键词的过度敏感,会直接破坏智能体的工具调用连贯性,迫使开发者在本地小模型与云端大模型间频繁切换,增加工程复杂度。
- 对AI安全治理而言,Anthropic承认Fable 5‘权衡取舍错误’、OpenAI将GPT-6.1 Sol列为‘关键级’却仍触发大量误拒,说明当前防护堆栈尚未实现‘能力分级’与‘意图识别’的解耦——同一模型既需执行高危渗透测试,又需支持日常安全编码,治理框架亟需按任务类型动态启用防护强度。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


