相关文章
495 篇高质量内容GPT Images 2.5 突发上线!网友的「灵魂画作」一个比一个离谱
OpenAI 正式发布 ChatGPT Images 2.5,重点提升图片细节质量、生成速度、编辑精度及多轮修改一致性;新增 Sketch 手绘参考、创作模板、图片评论编辑等功能;同步推出 GPT Image 2.5 Flare 与 Sunburst 两款 API 模型;用户每周通过该系列模型生成超 30 亿张图片。
技术解读|复杂人声干扰下,如何让 ASR “听对人”
本文剖析ASR在多说话人场景下的核心挑战:问题不在“听不清”,而在“听对人”。指出背景人声因具备语言结构,易被误转录;提出Target-Speaker ASR(依赖声纹注册)与前景说话人转录(依赖距离、方向、上下文等场景线索)两条技术路线;强调二者任务语义不可混用,但可共享数据底座;指出有效前景数据需明确定义时间、能量与空间三组关系。
DeepSeek Harness 更新-v0.1.2-alpha.1:体验全面打磨,子代理也能"点菜"选模型
DeepSeek Harness v0.1.2-alpha.1 版本实现能力与体验双升级:子代理首次支持按任务指定模型(含 Claude Code、Codex 等外部提供方),多模态图片回显与 Token 计入修复、持久终端等待状态精准识别、工程层统一 Remote 网关与 dsh profile 启动模式,并完成页面加载、会话交互、折叠导航等系统级体验优化。
GLM-5.3-Flash开源:人人都可低成本获得前沿智能
智谱发布开源模型GLM-5.3-Flash(320B-A18B),首个原生多模态GLM-5系列模型,在AA综合智能指数中获57分,能力对标Claude Opus 4.8,但定价仅为后者的1/40。其采用稀疏+线性混合注意力、流形约束超连接等架构创新,激活参数量与层数减半,并全程基于国产芯片集群实现高效推理。
GLM 5.3 Flash 这价格太离谱了,新的斩杀线
GLM 5.3 Flash Vision 正式发布,国产芯片支撑日均超100T算力供应;AI指数达57分,与Opus 4.8持平;限时定价为Opus 4.8的1/40,原价亦低于ds flash;采用320B参数、18B激活参数新架构,宣称实现高性能与低成本兼顾;强调原生多模态能力,支持视觉环境感知与Blender自主建模。
扔个 PPT 进去,30 秒吐出一条视频:拆解阿里 Wan3.0
8月24日阿里通义万相Wan3.0正式上线,支持PPT、PDF、Excel等办公文档直转30秒1080p视频,主打‘文档即视频’能力。其单次生成时长达30秒,为当前主流闭源模型中最长;输入支持文档类型为竞品所无。该模型未开源权重,仅通过阿里云百炼、千问AI平台及wan.video提供API与体验入口。
Qwen3.8-Flash:全新架构,更强更稳更划算
通义千问发布Qwen3.8-Flash多模态MoE模型,主模型125B参数+51B N-gram Embedding,每token激活6B。采用GDN+QSA混合注意力、Gated Residual、N-gram Embedding与Muon Optimizer四大架构升级,支持262K原生上下文(可扩至1M),训练开销仅为Qwen3.7-Plus的1/9,API定价为每百万tokens输入1元、输出3元。
DeepSeek小模型长了眼睛,Agent基准干翻顶级闭源模型
DeepSeek发布V4-Flash-Vision-Exp多模态视觉实验版,在Agents' Last Exam和ZeroBench等Agent基准测试中超越Opus-4.8等顶级闭源模型;视觉能力加入后文本性能未下降,且图片token消耗仅384个,Files API免费;该模型聚焦Agent工作流闭环,验证了轻量级多模态Agent能力的可行性。
V4-Flash-Vision-Exp 上线,开启多模态 API 服务
DeepSeek 推出实验性多模态视觉理解模型 V4-Flash-Vision-Exp,通过 API 提供图文混合输入支持。该模型在纯文本能力上与 V4-Flash 持平,在多模态 Agent 基准测试中表现接近 Opus-4.8。支持 Chat Completions 等三种调用格式及 Files API 图片复用,计费按 token 统一标准。
DeepSeek Harness 更新:官方多模态支持
DeepSeek Harness 连续发布 v0.1.0-rc.7、v0.1.0-rc.8 和 v0.1.1-rc.1 三个版本,重点增强多模态能力(新增 DeepSeek-V4-Flash-Vision-Exp 模型支持图文输入)、子代理协作灵活性(Codex/Claude Code 接入 Job Panel)及稳定性(修复长会话、终端兼容等问题)。MCP/ACP 支持图片附件持久化,PTC Mode 支持转发嵌套图片。
DeepSeek终于长出“眼睛”,V4 Flash视觉模型上线
DeepSeek于8月21日上线deepseek-v4-flash-vision-exp,为其V4 Flash模型首次引入原生图片输入能力。该模型支持1M上下文、384K输出长度,沿用V4 Flash同档定价,图片按尺寸折算为Token计费。其发布紧随Harness框架更新之后,旨在补全Agent系统的感知入口,当前仍标注为实验版本(Exp)。
昨夜,DeepSeek Harness首发新版本:14项更新,多模态能力拉满!
DeepSeek Harness于8月20日发布v0.1.0-rc.8版本,共14项更新,重点增强多模态输入能力,支持原生图片请求与图文混合指令;新增OCR、颜色统计、像素扫描等工具链,使纯文本模型可间接处理图像;Claude Code与Codex接入子代理体系,Windows终端体验优化,并修复流式生成、大图请求、自定义网关调用等关键问题。
DeepSeek Harness重磅更新:原生解锁多模态
DeepSeek Harness RC.8版本发布,原生支持多模态图文输入,/goal、/plan等命令可接收图片;Claude Code与Codex作为Profile Bundle按需安装;修复图片载荷过高导致请求失败等问题,并优化SQLite后端性能与界面交互体验。
Qwen3.8-27B:可在高端笔记本本地运行的前沿级编码与智能体模型
阿里巴巴发布开源多模态模型Qwen3.8-27B,仅需17GB显存即可在消费级设备运行,支持图像/视频理解、超长上下文与智能体工作流,在多项编程与智能体基准中媲美Claude Opus等专有模型。
太快了!聊聊 DeepSeek Harness 必装的插件。
DeepSeek Harness 基于 Cordis 插件系统构建,社区已快速开发出覆盖开发体验(WebUI 增强、TUI、桌面端)、视觉/多模态(识图、OCR、本地视觉模型代理)、记忆与工作流(本地三层记忆、自动化任务、多 Agent 调度)、工具集(数据库连接、设计画布、插件市场)等方向的数十个插件。文章逐一介绍 dsh-better-sidebar、dsh-TUI、deepseek-harness-desktop、dsh-vision-toolkit、dsh-mnemon、dsh-workflow 等核心插件的功能、安装方式与适用场景。
17GB内存就能跑!阿里开源最强27B多模态Qwen3.8,消费级显卡直接上
阿里开源Qwen3.8-27B原生多模态稠密模型,支持26.2万token上下文(可扩展至100万),Apache 2.0协议。Unsloth提供Dynamic GGUF量化方案,4bit仅需17–19GB内存,2bit可压至11–13GB,消费级显卡或24GB内存Mac即可本地部署。视觉能力原生集成,编码(SWE-bench Pro 61.7)、办公(CoWorkBench 70.7)及长视频理解表现突出。
智体新境|从模型到端侧,Google AI 开发全链路升级
2026 Google 开发者大会集中展示 Google AI 在模型能力、多模态、智能体开发与端侧部署四个层面的最新进展。Gemini 3 系列与 Gemma 4 开放模型提供差异化选择;Gemini Omni Flash、Lyria 3 和 Live API 推进多模态交互;AI Studio、Antigravity 2.0 与 Gemini API 构建智能体开发闭环;MediaPipe Tasks、LiteRT-LM 与 LiteRT 形成分层端侧技术栈。
Meta 发布 Apache 2.0 许可的 30B 多模态智能体模型 Muse Glimmer,支持 24GB 消费级硬件本地运行
Meta 推出开源权重模型 Muse Glimmer(29.6B 参数),采用 Apache 2.0 许可证,专为本地自主智能体设计,支持文本-图像交错输入、工具调用与错误恢复,并可在 24GB VRAM 设备上量化运行。
微软开源Orchard:一个让AI智能体“动手干活”的统一平台
微软开源Orchard框架,提供统一的Orchard Env操作环境服务,支持AI智能体在代码、浏览器与通用计算机环境中执行真实任务。其核心价值在于标准化沙箱基础设施、预置主流Agent Harness、高效并行能力(1000环境/26秒)及三类落地Recipe(SWE/GUI/Claw),并开源107K条SWE轨迹与3K条GUI多模态数据集。
Qwen3.8-Max发布:2.4万亿参数MoE多模态模型挑战智能体计算前沿
阿里巴巴Qwen团队发布Qwen3.8-Max,2.4万亿参数混合专家多模态大模型,在OSWorld-Verified等智能体计算基准中超越GPT-5.6 Sol Max与Fable 5,并承诺下周开源权重;其长周期任务执行能力、计算机使用能力和经济性定价引发企业级智能体部署新讨论。



















