谷歌正式发布开源模型 Gemma 4系列,不得不说,谷歌还是太全能了!
Gemma 4 基于与 Gemini 3 相同的研究和技术构建,这次最大变化是谷歌终于采用 Apache 2.0 开源协议发布,允许商业使用,开发者对数据、基础设施和模型拥有完整控制权,可在本地或云端任意环境部署,这比之前的 Google 自家的许可协议好得多。
四个尺寸,覆盖从手机到工作站
本次发布共四个版本:E2B、E4B、26B MoE(混合专家)和 31B Dense(稠密模型)。
其中,31B 模型在 Arena AI 文本排行榜上位列全球开源模型第三,26B 模型排名第六。这两个模型可以在参数量仅为竞争对手二十分之一的情况下超越对方。
谷歌野心很大,这次要改变端侧市场!E2B 和 E4B 专为移动端和物联网端设备设计,支持多模态能力、低延迟处理,可在手机、树莓派、NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行。谷歌与 Pixel 团队、高通、联发科等移动硬件厂商紧密合作,推动这两款模型落地。Android 开发者现在可以通过 AICore 开发者预览版提前体验智能体开发流程。
全系模型标配原生处理图像和视频,支持可变分辨率,擅长 OCR 和图表理解。E2B 和 E4B 还支持原生音频输入,可语音识别和理解,E4B 和 E2B 听起来像是为传说中的苹果新 Siri准备的。
端侧模型上下文窗口为 128K,大模型最高支持 256K,可在单次提示中传入完整代码仓库或长文档。
原生支持 140 多种语言训练。
多步规划和复杂逻辑推理能力增强,在数学和指令跟随基准测试上表现突出。
原生支持函数调用、结构化 JSON 输出和系统指令,可构建能与外部工具和 API 交互的自主智能体。
支持高质量离线代码生成,可将本地工作站变成 AI 代码助手。
硬件适配方面
26B 和 31B 模型的未量化 bfloat16 权重可在单张 80GB NVIDIA H100 GPU 上运行,量化版本则可在消费级 GPU 上本地运行。
26B MoE 模型在推理时只激活 38 亿参数,在保证速度的同时降低硬件需求;31B Dense 则追求更高质量,也是微调的更好基础。
谷歌已通过这一路线验证了实际效果,包括:INSAIT 基于 Gemma 构建了保加利亚语优先的语言模型 BgGPT;与耶鲁大学合作的 Cell2Sentence-Scale 项目发现了癌症治疗的新路径。
