JOTO
Contact us
← AI 智库
模型与技术专题

大语言模型

整理大语言模型相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

6836 篇高质量内容
大语言模型
大语言模型
大语言模型

为什么我选 WorkBuddy 而不是 Codex

深入了解中国开发者工作痛点,WorkBuddy 从网络、语言、技术栈到合规,为国内场景量身打造。 核心内容: 1. Codex 的优势与局限性分析 2. WorkBuddy 针对中国开发环境的四大优化 3. 国内技术选型与合规要求的实际考量

大语言模型
大语言模型
大语言模型

没想到,DeepSeek建模潜力被ORGEval挖出来了

DeepSeek-V3在ORGEval评测中意外夺冠,揭示传统大模型评测的盲区。 核心内容: 1. 传统大模型优化建模评测的三大缺陷 2. ORGEval如何通过图论方法精准评估模型 3. DeepSeek-V3等非推理模型的意外表现与启示

大语言模型
大语言模型
大语言模型

从提示 Agent 到循环工程

从写提示词到设计循环,AI编程的新范式正在改变开发者的工作方式。 核心内容: 1. Agent loop的定义与核心四步流程 2. 五种不同“循环”概念的演进与对比 3. 生产环境中的实际应用与未来展望

大语言模型
大语言模型
大语言模型

微信小微,几个要点

微信AI助手小微开启小范围公测,它如何重塑你的微信使用体验? 核心内容: 1. 小微的模型架构与隐私保护策略 2. 小微“小工具”功能如何满足个性化需求 3. 小微如何通过语音交互重新定义微信使用方式

大语言模型
大语言模型
大语言模型

AI 也会做梦?拆解 OpenClaw 独特的梦境记忆系统

OpenClaw 如何让 AI 像人一样记住重要经验?通过独特的“梦境记忆系统”,让记忆在反复验证中自动升级,告别对话失忆的困扰。 核心内容: 1. 记忆系统的根本矛盾与核心设计:通过价值证明积累持久记忆 2. 三阶段文件存储架构:从日记草稿到深度梦境验证的完整流程 3. 以一条具体规范为例,展示记忆从产生到升级的完整旅程

大语言模型
大语言模型
大语言模型

[译] 我所知的全部智能体工程技巧

探索智能体工程如何从“玩具”变生产力,揭秘高效交付的实战技巧。 核心内容: 1. 从Vibe Coding到智能体工程的演变与关键工具 2. 核心原则:用`/ce-plan`即刻将想法转化为可执行计划 3. 智能体并行工作流解析与实战案例

大语言模型
大语言模型
大语言模型

13人团队叫板Anthropic:我们造了一个更快更便宜的大模型

Subquadratic 声称解决了Transformer的数学瓶颈,打造出更快、更便宜的大模型SubQ,引发业界关注与质疑。 核心内容: 1. SubQ模型在速度、成本与能耗上的突破性宣称 2. 第三方独立评估结果与持续的行业质疑 3. 该技术对LLM架构与效率新时代的潜在影响

大语言模型
大语言模型
大语言模型

微信左上角长出“两只眼睛”:小微测试版,可能是微信 AI 化最关键的一步

微信推出小微AI助手,将AI能力融入社交生态,一键解决用户日常需求。核心内容:1. 小微AI助手的四大核心能力展示2. 微信布局AI的战略意图与生态价值3. 小微作为“任务代理”的独特产品定位

大语言模型
大语言模型
大语言模型

Agent Skill 管理范式探索:像管理软件包一样管理 Agent 能力

探索Agent Skill管理新范式:像管理软件包一样,将Agent能力沉淀为可复用、可发布的企业级资产。 核心内容: 1. 当前Agent Skill管理面临的挑战与痛点 2. 从具体任务到通用能力的工程化沉淀过程 3. 构建统一Skill Hub管理范式的核心思路与价值

大语言模型
大语言模型
大语言模型

企业智能体的下半场,如何让智能体越用越聪明?

让企业智能体越用越聪明,关键在于构建高效的进化飞轮。本文聚焦业务场景Agent,剖析其进化难点与工程实践。 核心内容: 1. 企业智能体进化的两类场景与当前挑战 2. 构建进化飞轮面临的数据采集与评估难题 3. 应对挑战的工程思路与实践方案

大语言模型
大语言模型
大语言模型

你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布

Harness工作流是否真的在进步?告别主观评价,用可量化的考试体系为你的工作流“撕掉遮羞布”。 核心内容: 1. 主观评价驱动Harness工作流的困境与失控风险 2. 从“测试”到“考试”的哲学跃迁与核心原理 3. Harness Eval评测系统的设计思路与价值

大语言模型
大语言模型
大语言模型

Agent 记忆,我们全都理解错了?

Agent 记忆的概念被过度包装?本文直击本质,梳理Agent记忆的四层理解,帮你穿透迷雾。 核心内容: 1. 早期记忆理解的局限性 2. CoALA分类法如何定义广义记忆 3. 从工程实践看记忆演进的未来方向

大语言模型
大语言模型
大语言模型

多 Agent 并行与 Headless 模式:让 Claude Code 效率翻 10 倍

用多 Agent 并行与 Headless 模式,将 Claude Code 的代码处理效率提升一个数量级,无缝集成至开发工作流。 核心内容: 1. 四种并行 Agent 模式及其适用场景对比 2. Subagents 作为轻量级助理团的具体功能与应用 3. Headless 模式如何嵌入 CI/CD 实现自动化

大语言模型
大语言模型
大语言模型

拆解大模型几项核心操作背后的数学与 Infra 优化逻辑

深入解析大模型核心操作背后的数学与工程智慧,揭秘如何用数学优化换取极致性能。 核心内容: 1. 剖析RMSNorm、Softmax等关键操作的数值挑战 2. 揭示数学等价变换与精度妥协的工程权衡 3. 探讨硬件利用与推理速度的优化逻辑

大语言模型
大语言模型
大语言模型

更可靠的主播助理:淘宝主播Agent的Harness工程实战

淘宝直播的极端环境,如何靠Harness工程让AI主播助理变得真正可用、可控?一场直播就是一场高压测试。 核心内容: 1. Harness工程在淘宝主播Agent中的核心定义与六大职责 2. 应对直播“高压测试”的四大工程挑战与解决方案 3. Harness架构如何从零散技巧升级为系统化“河道与护栏”

大语言模型
大语言模型
大语言模型

Business Insider:揭秘 Cursor 的疯狂崛起

揭秘Cursor如何从天才少年的10分钟测试,到与马斯克SpaceX签下600亿美元大单,背后是野心、高压文化与生死时速的转型。 核心内容: 1. 创始人Michael Truell的天才起点与宏大野心 2. Cursor内部高压工作文化及与Anthropic的紧张关系 3. 公司将命运绑定SpaceX以应对生存威胁的关键决策

大语言模型
大语言模型
大语言模型

如何搭建一个端到端业务需求专家 Agent

打造端到端业务需求专家Agent,让AI真正串联从需求到上线的全流程,解放人力,沉淀经验。 核心内容: 1. 解决业务需求交付中的三大工程化瓶颈 2. 系统四层架构与闭环运作机制 3. 实践案例与未来迭代方向

大语言模型
大语言模型
大语言模型

谁是 Agent 最强守门员?首个 Agent 技能安全评测基准 SkillTrustBench 正式发布

首个面向Agent技能安全评测的基准SkillTrustBench发布,为行业提供客观衡量标准,解决安全方案检测与技能可信度评估难题。 核心内容: 1. Agent技能安全威胁与行业检测困境 2. SkillTrustBench基准的构建与核心数据 3. 首期评测对模型、工具及技能本身的关键发现

大语言模型
大语言模型
大语言模型

Agent skill 迭代式编写实战

将专家经验转化为AI可执行的“操作手册”,实现零依赖部署与双重验证。 核心内容: 1. Agent Skill的概念、形态与适用场景 2. 三层渐进式披露架构与确定性脚本化设计 3. 内部自查与外部评估的双重验证机制

大语言模型
大语言模型
大语言模型

GPT-5.5和Opus 4.8都搞不定的Bug,被Fable 5一晚上解决

Fable 5 如何用一套“破案监控系统”,解决了GPT-5.5和Opus 4.8都束手无策的诡异Bug。 核心内容: 1. 一个无法复现、全球随机的用户账号“互串”悬案 2. GPT-5.5与Opus 4.8给出的不同诊断与局限 3. Fable 5的独特思路:停止猜测,设计取证系统