JOTO
联系我们
← 资讯中心
产品更新

Thinking Machines 发布 Inkling-Small:2760 亿参数开源多模态模型,性能逼近旗舰版且仅需四分之一计算资源

2026 年 7 月 31 日 · JOTO 团队 · 10 分钟阅读

Thinking Machines 推出开源多模态模型 Inkling-Small(2760 亿参数),在 Artificial Analysis 智能指数中仅比 9750 亿参数的 Inkling 低 1 分,多项编程与推理任务反超;支持文本/图像/音频输入,上下文达 100 万 token,采用 Apache 2.0 许可,需至少 4 块 B300 或 8 块 H200 GPU 部署。

Thinking Machines debuts Inkling Small open source AI model nearing performance of predecessor at about 1/4 size

就在 Thinking Machines 发布其首款开源 AI 语言模型 Inkling仅两周后,这家资金雄厚的初创公司 由前 OpenAI 首席技术官 Mira Murati 领导 今日 推出了 Inkling-Small 且未显著牺牲任何性能——事实上,新模型在若干基准测试中已超越其更大的前身。

Inkling Small 是一款拥有 2760 亿参数的多模态推理模型,采用宽松的 Apache 2.0 许可证,在第三方 Artificial Analysis 智能指数(Artificial Analysis Intelligence Index)上得分与其更大的兄弟模型仅相差 1 分,而原始 Inkling 的参数量为 9750 亿(内部模型设置)。该模型支持文本、图像和音频输入,输出文本,并支持最高达 100 万 token 的上下文窗口。

Inkling Small 每 token 使用 120 亿活跃参数,相比之下 Inkling 每 token 使用 410 亿活跃参数,同时保留了旗舰模型大部分的编码、推理及多模态性能。

对企业而言,Inkling-Small 的吸引力不仅在于其体积更小,更在于开发者似乎仅需放弃相对较少的能力,即可大幅降低模型的计算需求、推理成本及部署占用空间。

该模型对笔记本电脑或常规工作站而言仍过于庞大,但相比体积大 3.5 倍的旗舰模型,其运行难度显著降低,因此非常适合拥有一些——但并非大量——自有图形处理器(GPU)的企业。

Thinking Machines 已在 Hugging Face 上发布完整权重 并为其 Tinker 模型训练应用程序编程接口(API)增加了微调支持。

发布初期,该公司正提供限时 50% 折扣:标准 64K 上下文 Inkling-Small 模型的 API 定价为每百万预填充(输入)token 0.58 美元、每百万采样(输出)token 1.44 美元、每百万训练 token 1.73 美元;缓存预填充请求定价为每百万 token 0.116 美元。另提供更高费率的 256K 上下文变体。

四分之一的体积,近乎相同的性能

Artificial Analysis 为其智能指数(Intelligence Index)赋予 Inkling-Small 40 分,而 Inkling 得分为 41 分。

这一结果值得注意,因为 Inkling-Small 总参数量为 2760 亿、活跃参数量为 120 亿,而 Inkling 总参数量为 9750 亿、活跃参数量为 410 亿。

Artificial Analysis 还报告称,目前尚无任何开源权重模型在 Inkling-Small 的尺寸或更小尺寸下于该指数中获得更高分数。

该模型所实现的远不止是接近旗舰模型的综合得分;在若干评估中,其表现甚至超越 Inkling。

Thinking Machines 报告称,Inkling-Small 在 SWE-bench Verified 上得分为 80.2%,高于 Inkling 的 77.6%;在 Terminal Bench 2.1 上得分为 64.7%,高于更大模型的 63.8%;此外,在 SciCode、Humanity’s Last Exam、GPQA Diamond 和 CritPt 上亦小幅领先。

但这些提升并非普遍适用。Inkling 在事实性知识及部分智能体任务上仍具有明显优势。Inkling-Small 在 τ³-Banking 上得分为 15.5%,低于 Inkling 的 23.7%;其 AA Omniscience 得分为负值,反映出事实覆盖能力较弱,尽管其报告的幻觉率略低。

这一权衡对企业至关重要。Inkling-Small 可能适用于代码助手、工具使用系统、检索增强生成(RAG)、文档分析及多模态工作流,但若将其用于高风险的事实性任务,组织仍需依赖检索、验证及人工审核。

一款 2760 亿参数模型如何每次仅使用 120 亿参数

Inkling-Small 是一种稀疏的专家混合(Mixture-of-Experts)模型。根据 Thinking Machines 发布的模型卡片(model card) ,其 42 层解码器将每个 token 路由至 256 个专业专家中的 6 个,外加两个对每个 token 均保持活跃的共享专家。

该架构有助于解释模型总参数量(2760 亿)与其活跃参数量(120 亿)之间的差异:系统保有庞大的学习能力池,但在每次推理步骤中仅激活其中一小部分。

该模型原生即支持多模态。图像、音频与文本被投影至共享表征空间,并由解码器联合处理,而非通过完全独立的外部系统分别处理。Thinking Machines 列出的预期用途包括代码助手、智能体应用、聊天机器人、RAG 系统及其他多模态应用。

该公司还支持可变推理开销,允许开发者根据任务难度增减模型在推理时的计算资源。这为工程团队提供了直接方式,以在不同工作负载间平衡质量、延迟与成本。

遗憾的是,“小”并不意味着它能在笔记本电脑上运行

尽管名为 Inkling-Small,但它并非面向消费者级别的模型。

据 Thinking Machines 称,标准 BF16 检查点至少需要 600 GB 的聚合 GPU 内存。该公司列出两种支持配置:4 块 NVIDIA B300 GPU 或 8 块 NVIDIA H200 GPU。

量化后的 NVFP4 检查点将所需内存降至约 180 GB 聚合显存(VRAM)。Thinking Machines 表示,该版本可在单块 NVIDIA B300 上以 W4A4 模式运行,或在两块 H200 GPU 上以 W4A16 模式运行。

这意味着普通笔记本电脑、MacBook、桌面游戏 PC 及大多数开发人员工作站均被排除在外。即使配备高端硬件的本地系统,通常也远未达到所需内存容量。

实际部署目标为企业的 GPU 服务器、云集群及专用推理服务商。“Small”这一标签因此是相对于 Inkling 而言,而非相对于整个本地模型生态而言。

尽管如此,这一缩减仍具实际意义。一款在性能上接近 Inkling、却需显著更少聚合内存的模型,可降低托管成本、简化容量规划,并扩大具备自托管能力的组织范围。

对于希望掌控数据、模型行为及微调能力的公司而言,这种更小的部署足迹可能比追求最高基准测试分数更为重要。

当然,由于其开源属性,该模型无疑将迅速被量化(即降低精度以减少计算需求),并很可能与其他模型融合,从而进一步缩小体积以适配消费级硬件。

Apache 2.0 是企业级开源模型的黄金标准

许可证的重要性可能不亚于基准测试结果。

Inkling-Small 采用 Apache 2.0 许可证发布,这是软件行业中最为人熟知的宽松许可证之一。该许可证通常允许组织在遵守许可证通知与署名要求的前提下,自由使用、修改、微调、再分发及商业化该模型,包括将其集成至专有产品中。

这为企业提供的法律灵活性远超许多定制化的所谓“开源”AI 许可证——后者可能包含营收门槛、品牌义务、使用限制,或针对大规模商业部署的单独条款。

随着越来越多的AI公司发布模型权重却不采用传统的开源许可证,这一区别正变得日益重要。

例如,中国AI明星企业月之暗面(Moonshot) 本周早些时候发布了其前沿级Kimi K3模型的权重 所采用的是一种定制的“开放”许可证,该许可证包含额外的商业条款,而非Apache 2.0许可证相对直白的条款。

对于法务、采购及平台团队而言,这一差异可实质性简化采用流程。Apache 2.0并未消除审查可接受使用政策、数据来源、监管风险或下游安全义务的必要性。但它为组织构建内部系统、推出商用产品以及维护模型修改版本提供了更清晰的起点。

一条更具可复现性的模型开发流水线

Inkling-Small还展示了Thinking Machines如何迅速将其首个大模型发布转化为一条可复现的工程流程。

Thinking Machines研究员 Horace He在X平台的一篇帖子中对比了这两次发布

“发布Inkling时我感觉像需要全村之力,而发布Inkling-Small则显得常规得多😆 我们只是沿用了Inkling所用的流水线,输入一个更小的模型,就成了——新模型诞生!Inkling-Small相较于Inkling从若干细微改进中获益颇多,但仍有大量潜力尚未释放……”

这条评论表明,该公司已不再将每个模型视为一次性研究项目,而是正在构建一套可复用的流水线,涵盖预训练、后训练、强化学习、评估与发布各环节。

Thinking Machines表示,Inkling-Small受益于改进后的预训练数据组合、机器学习配方的调整,以及以Inkling为教师模型进行的策略内蒸馏(on-policy distillation)。随后,团队又持续进行了为期两周的智能体编程强化学习(agentic coding reinforcement learning)。

Mira Murati在她自己的帖文中也强调了相同观点,将Inkling-Small描述为尺寸仅为Inkling四分之一但能力相当的模型,并着重指出其权重已开源,且可立即在Tinker平台上进行微调。

企业与AI构建者应如何思考Inkling-Small

该公司还分发完整的BF16和NVFP4检查点,并通过SGLang、vLLM、TokenSpeed、Unsloth及Hugging Face工具链支持部署。

这种组合为开发者提供了多种部署路径:使用API、通过Tinker进行微调、依赖第三方推理服务提供商,或在私有基础设施上运行该模型。

Inkling-Small并非大多数个人用户会下载并在本地运行的模型。但对于在超大规模旗舰模型与更易管理的开源权重系统之间做选择的企业而言,它提供了一种极具吸引力的折中方案:实测智能水平几乎相当,在多项编程与推理任务上表现更强,单token定价更低,硬件资源占用更小,且许可证允许广泛的商业开发。

更广泛的信号或许同样重要:Thinking Machines正表明,Inkling并非一次性的发布。该公司已在压缩其模型家族、精炼其训练流水线,并朝着一种节奏迈进——即开源权重多模态系统能够被更常规地生成、改进与部署。

JOTO 企业落地观察

  • 对企业部署而言,Inkling-Small 将聚合显存需求从 Inkling 的约 2100GB(BF16)降至 600GB,使中等规模 GPU 集群(如 4×B300)即可承载,显著扩大自托管适用范围,但仍未脱离数据中心级硬件门槛。
  • 对智能体工程而言,该模型原生支持多模态联合表征与可变推理开销,且在 SWE-bench、Terminal Bench 等智能体编程基准上超越 Inkling,为工具调用、代码生成与 RAG 增强型智能体提供更高效、更易微调的开源基座。
  • 对 AI 安全治理而言,Inkling-Small 在事实性任务(如 τ³-Banking、AA Omniscience)上明显弱于 Inkling,幻觉率虽略低但覆盖能力不足,提示企业在高风险场景中必须叠加检索验证与人工审核,无法仅依赖模型输出保证准确性。
想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。