亚马逊开源决策模型 Strands Decider 2B:专为智能体工作流设计的轻量级实时判断工具
亚马逊发布开源决策模型 Strands Decider 2B,基于 Qwen 微调,20 亿参数,单次前向传播输出选项概率,在本地 RTX 3090 上中位延迟 106 毫秒。它不生成文本,专注工具调用前的快速判断,支持自托管、微调与深度集成。

让 AI 智能体变得更便宜、更快的竞赛,正超越仅负责撰写答案的模型。自 TypeSafe AI 推出 Jev以来的两周内——这是一种不生成段落文本、而是从预定义选项中进行选择的模型——开发者已密集发布了一批竞争性决策模型,其中许多模型提供可下载的权重文件。
如今,亚马逊也加入这一行列,推出一款开源模型,专为嵌入智能体工作流内部而设计,用于判断某项拟议操作是否应继续执行: Strands Decider 2B,这是一款基于阿里巴巴 Qwen 基础模型微调而成、参数量约为 20 亿的模型,它通过单次前向传播,对有界问题以选项加概率的形式作答。
该开源模型可免费从 Hugging Face 下载,并在对企业友好、宽松的 Apache 2.0 许可协议下使用;不过开发者须自行提供运行该模型所需的硬件或云计算资源。
亚马逊表示,开发者还可下载其训练材料,并利用该模型来路由请求、选择工具、评估输出,或审查智能体的操作。
此次发布属于 Strands Labs项目的一部分,这是 AWS 开展的实验性智能体开发计划。AWS 在美东时间中午正式发布前,向 VentureBeat 提供了最终公告及三张技术图表。
其核心理念十分简单:若某程序需要回答诸如“该工具是否应运行?”或“以下三条路径中哪一条符合此请求?”之类的问题,调用大型语言模型撰写解释性文本会增加时延与成本。而决策模型则直接对允许的答案进行打分。这使其可作为围绕更强大智能体的高频、窄域检查点,同时将写作、编程与复杂推理任务留给生成式模型。
AWS 构建了什么
Strands Decider 起始于预训练的 Qwen3.5-2B 基础模型。据 AWS 称,其开发人员移除了预测下一个词的组件,并代之以一个小型“指针”组件,用于对提供的答案选项进行打分。
他们采用秩为 16 的 LoRA 更新对基础模型进行了适配,并训练了这一新型打分组件;AWS 表示该组件仅额外增加略超一百万个参数。随公告发布的架构图将此设计标注为“Hobson”。与聊天机器人不同,它仅执行一次前向传播,即返回一组针对可用选项的概率分布。
AWS 表示,其团队快速迭代开发,将随代码、训练数据及脚本一同发布第 20 版。这种开放性是该方案的重要组成部分:开发者可检视其构建方法、对该模型进行微调,并在其自有基础设施上运行,而非将每次决策都发送至外部 API。
AWS 公告中的示例将该决策器置于智能体调用天气工具之前。若用户未指明地点便查询天气,演示中的智能体会猜测一座城市。Strands Decider 审查对话内容及拟议的调用请求,判断该城市是否源自用户的请求,以及此时调用工具是否为时过早。应用代码随后依据其回答,指示智能体返回并向用户询问具体城市。
该示例使用了 Strands 智能体框架既有的 干预机制,该机制可选择继续执行、拒绝工具调用、请求确认,或通过反馈引导智能体。
AWS 表示,该示例中所用问题及阈值系人工选定,专用决策模型集成库仍在开发中。该模型仅提供判断结果;开发者仍需自行定义应用程序如何使用该结果。
它的速度与准确率如何?
AWS 表示,该模型在短任务上可在本地数十毫秒内完成决策,在某些常见硬件与输入条件下,耗时低于 100 毫秒。

任务规模(以 token 数计)与决策延迟关系图,于本地 Nvidia RTX 3090 显卡上针对模型 v18 测得。延迟随任务规模近似线性增长。图片来源:亚马逊
与此同时,TypeSafe 报告称,其托管服务端到端的 Jev 响应时间约为 70 至 500 毫秒。 TypeSafe 报告称,其托管服务端到端的 Jev 响应时间约为 70 至 500 毫秒。
亚马逊随附的 Jev 延迟图表则提供了更具体、更具限定条件的视角: 第 18 版 在本地 Nvidia RTX 3090 上对 230 次请求(含 HTTP 往返)的测试中,记录的中位延迟为 106 毫秒 ,第 95 百分位延迟为 296 毫秒 。较长提示通常耗时更久。
该图表排除了服务器预热期间首次请求耗时的 7.7 秒;AWS 还报告称,在 M3 MacBook 上处理小型任务时,中位延迟约为 150 毫秒。这些数值不应被表述为统一的、始终低于 100 毫秒的保证。
在质量方面,AWS 使用公共部分的 JevBench,同时衡量准确率与概率可信度(采用 Brier 分数)。其图表追踪了从早期版本直至 第 19 版的演进过程,后者较团队此前的检查点有所改进。

训练轨迹上的准确率与校准度(Brier 分数)。随着架构在连续版本中演进,两项指标在 JevBench 公共数据集上均得到提升。图片来源:亚马逊
图表中标注的 v19 点对应约 72% 的准确率与 0.35 的 Brier 分数,而图表中将尺寸相近的 Mapika decider-2b v11 置于约 76% 与 0.32,分别如此。更高的准确率和更低的Brier分数更优,因此在两项指标上该比较均有利于Mapika。
AWS表示,其模型在此测试中,在规模相近的公开模型中排名第二,在公布完整训练配方的同类模型中排名第一。该图表未显示计划发布的20版结果,且其绘制的对比中未包含Jev本身。无论是邮件还是这些图表,均未证实Strands Decider在整体上优于Jev。
网络距离、请求形态及运营成本各不相同。一位亚马逊发言人以不具名方式表示,AWS目前仅提供开源模型,暂无托管API或按次调用收费。
该发言人称,开发者可在MacBook上运行该模型,但使用自有设备或云基础设施仍会消耗资源;亚马逊未提供可与API费率相类比的通用每令牌或每次请求运营成本估算。
这使得运行Strands Decider与付费使用Jev服务的相对成本仍未得到验证。
Jev激发了一个快速发展的领域。
TypeSafe于9月15日推出Jev。,称其为“System One”模型。它接收应用状态和类型化问题,随后返回选项、分数或“是/否”概率,而不生成书面答案。TypeSafe收费。 每百万输入令牌0.042美元。,不收取输出令牌费用,并称其后训练着重于概率校准。其模型通过API访问;TypeSafe尚未发布Jev的权重或完整训练配方。
该方案的吸引力及其局限性已迅速引发审视。 VentureBeat曾报道。 该方法借助更强大的现代预训练模型复兴了分类任务:许多企业系统需要的是标签或路由决策,而非一段文字。另一项。 VentureBeat调查。 表明,廉价的概率型防护机制无法充当万无一失的安全边界:代理输入中的对抗性文本可能影响其判定结果。TypeSafe及其集成合作伙伴已承认这一风险。
该类别扩展速度几乎与围绕它的讨论同步加快。 Laya。 采用基于ModernBERT的更小型设计(参数量为4.21亿),用于本地决策。 Jared Palmer的Kev。 发布了一系列模型及研究路径。
Bespoke Nimble 9B。 提供Apache许可证授权的适配器及参考代码。 Mapika的decider系列。 涵盖多种尺寸,并公开训练代码及模型卡片。
FLock的。 this-that-model。 是另一款小型、可本地运行的竞品。它们在架构、训练方式、硬件要求以及置信度估计的稳健性方面各不相同;共用“决策模型”这一标签并不意味着其基准测试结果可互换。
斯坦福大学与英伟达(Nvidia)的研究人员采取了一条相关路径,推出了开源。 CLM-8B。,该模型可缓存可复用操作的表征。VentureBeat报道称,在研究人员的测试中,其在某些任务上的运行速度最高可达Jev的九倍,但在工具调用准确率上落后于Jev。该结果仅适用于其特定工作负载与测试设置,但它说明了专业化替代方案正如何迅速探索不同的速度与准确率权衡。
类别。 | Strands Decider 2B vs. Jev。 | 现有证据支持的内容。 |
前期/API价格。 | Strands优势。 | AWS表示该模型可免费下载和使用,不提供托管API,亦无按次调用费用。Jev收费。 每百万输入令牌0.042美元。 。 |
总体运营成本。 | 尚不明确。 | Strands要求用户自行提供CPU/GPU或云算力。AWS未提供每次请求或每令牌的运营成本估算,因此无法确认其实际运营成本是否确实低于Jev极其低廉的托管API。 |
速度。 | 大致相当,未证实有胜出。 | AWS在RTX 3090显卡上对早期Strands检查点进行测量,结果为。 中位数106毫秒 / p95为296毫秒。TypeSafe报告。 托管Jev端到端响应时间为。 约70–500毫秒。不同硬件与网络条件使得无法直接确定孰优孰劣。 针对托管型 Jev 的端到端方案。不同的硬件和网络条件使得无法直接确定胜出者。 |
准确性 | 没有证据表明 Strands 优于 Jev | AWS 的图表显示 Strands v19 在公开 JevBench 上的准确率约为 72% 。该图表未包含 Jev 本身,因此不存在支持 Strands 在准确性上具备优势的直接对比结果。 |
校准 | 未证实 Jev 获胜或 Strands 获胜 | AWS 报告称 v19 的 Brier 分数约为 0.35 。但同样,Jev 本身未出现在所绘制的对比图中。TypeSafe 特别强调 Jev 在后训练阶段的校准能力,但此处提供的材料并未确立二者孰优。 |
开放性 | Strands 明显占优 | AWS 计划发布该模型、代码、训练数据及脚本;而 Jev 仅以 API 形式提供,TypeSafe 尚未发布其权重或完整训练流程。 |
自托管 / 隐私 / 控制 | Strands 明显占优 | Strands 可在本地运行(包括在 MacBook 上),因此企业可将决策保留在自身环境中,而非将其发送至外部 API。 |
定制化 | Strands 很可能占优 | 由于 AWS 公布了训练流程及相关材料,开发者可对其进行检查与微调。Jev 则未提供同等程度的模型级控制能力。 |
使用便捷性 | Jev 占优 | Jev 是托管式 API:调用即可,仅需支付极低的使用费用。Strands 则要求用户自行部署并维护推理服务。这虽更灵活,但也带来更多的运维工作。 |
AWS/Strands 集成 | 在该生态系统内 Strands 占优 | AWS 展示了 Strands 干预机制如何作为智能体执行动作前的检查点,与其直接协同工作。 |
在价格方面存在一个有趣的悖论:Strands 的标价为零,而 Jev 的运营成本已几乎可忽略不计。Jev 每百万输入 token 收费 0.042 美元,按此费率计算,十亿输入 token 仅需 42 美元。因此,除非企业已有闲置算力,或因隐私/控制原因高度重视本地执行,否则 AWS 尚未证明在计入硬件、云算力及运维开销后,自托管 Strands 能节省成本。
亚马逊无可争议地推动该类别向前发展的领域是 开源可复现性。TypeSafe 要求开发者信任并以服务形式使用 Jev;而亚马逊实质上是在说: 这是小型模型、训练流程、数据及配套工具——请自行运行并修改它。这对企业而言,可能比在基准测试中再挤出几个百分点更具战略差异化意义。
因此,AWS 的差异化主张并非一个经实证击败 Jev 的产品,而是一个开源、可复现的决策层,且与现有智能体框架深度绑定。
Strands 开发者可在工具调用前部署一个小型本地模型,判断不确定性是否达到需人工介入或交还智能体控制权的程度,并保留大语言模型(LLM)用于需生成能力的任务。其已发布的训练流程及可在笔记本电脑上运行的能力,可使希望掌控自身基础设施的团队更易开展实验。
决定性测试将超出发布时的示例场景:已发布的检查点能否在企业自身的政策、文档及特殊案例上持续保持准确性和良好校准;以及本地推理加运维是否优于 Jev 异常低廉的托管价格。对于敏感的工具调用,天气演示仅是有用的审查节点示例,而非证明单靠模型判断即可确保智能体安全的证据。
简言之:亚马逊推出了一款真正具备竞争力的 Jev 替代方案,其最突出的差异化优势并非基准测试性能更优,而是开源、可自托管且可复现。
JOTO 企业落地观察
- 对企业部署而言,Strands Decider 提供 Apache 2.0 许可的完整开源栈(模型、训练数据、脚本),允许企业在私有环境或边缘设备(如 M3 MacBook)运行,规避 API 数据出境与供应商锁定风险,但需自行承担推理资源与运维成本,其经济性取决于闲置算力存量及隐私合规刚性。
- 对智能体工程而言,该模型明确划分职责边界:将高频、窄域判断(如‘是否调用天气工具’)交由轻量决策层执行,保留 LLM 处理生成、推理与规划任务,推动智能体架构向‘决策-执行-生成’三层解耦演进,并通过 Strands 干预机制实现与现有框架的即插即用集成。
- 对 AI 安全治理而言,文章指出对抗性输入可能干扰决策模型判断,且 Strands Decider 本身仅输出概率结果,不提供内置防护逻辑;企业若将其用于关键工具审查(如金融交易、权限变更),必须额外构建置信度阈值、人工兜底与反馈闭环,不能仅依赖模型原始输出作为安全边界。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


