Skip to content
谷歌称Gemma 4只需1.1至2.5 GB内存就能装进手机,但8月推出的独立基准测试只公布了一款iPhone的手机运行时间
人工智能

谷歌称Gemma 4只需1.1至2.5 GB内存就能装进手机,但8月推出的独立基准测试只公布了一款iPhone的手机运行时间

插图:tuput

中文

苹果的端侧模型约有30亿参数,窗口为4,096个词元。谷歌给出Gemma 4 E2B和E4B的手机内存需求分别为1.1 GB和2.5 GB。几乎所有准确率分数都是开发模型的公司自己跑出来的,8月推出的独立手机基准测试,只公布了一款iPhone的运行时间。

· · 1 分钟阅读

谷歌的Gemma 4模型卡列出其较小的手机模型E2B有23亿有效参数,谷歌的体量表给出它的手机内存数字为1.1 GB,较大的E4B为2.5 GB。苹果的端侧模型是一个30亿参数的稠密网络,每次会话在4,096个词元的窗口内工作。截至2026年10月8日,这些都是厂商自己的数字,附在它们后面的大多数分数也是厂商自己跑出来的。

参数是模型里的一个学到的数字,词元(token)是一个词的片段,据苹果说,大约相当于三到四个英文字符。

苹果公布了什么

苹果在2026年6月8日发布了第三代基础模型,其中两个在手机上运行。AFM 3 Core是一个30亿参数的稠密模型。AFM 3 Core Advanced把200亿参数放在闪存里,每次请求激活其中10亿至40亿,并把选中的部分调入工作内存。苹果说,较大的那个是为它最强的芯片准备的,没有点出任何设备。两个模型它都没有给出内存数字。

开发者最先撞上的限制是窗口。苹果的技术说明TN3193(2026年3月31日更新)说,端侧模型每次会话的上下文窗口是4,096个词元。指令、提示、工具定义和模型自己的回复,全部计入其中。英文大约每个词元三到四个字符,中文、日文或韩文大约每个词元一个字符。

谷歌公布了什么

Gemma 4的模型卡给出E2B有23亿有效参数、含嵌入则为51亿,E4B分别为45亿和80亿。有效的意思是模型实际调用的参数量,之所以更低,是因为大型查找表不计在内。两种体量都支持128,000词元的上下文。

内存表列出4位版本的需求为2.9 GB和4.5 GB,在其LiteRT-LM运行时的手机一行下为1.1 GB和2.5 GB。仅文本的手机用法为0.84 GB和2.2 GB。这张表涵盖的是加载权重,据其注释,不含KV缓存,也就是随对话增长的工作内存。

Gemini Nano是安卓手机通过AICore系统服务运行的版本,出自这个系列。谷歌2026年4月2日的文章说,Gemma 4是Gemini Nano 4的基础,并称它比上一版本快至多4倍、耗电最多减少60%。文章没有给出这两项说法的测试条件。ML Kit页面把Nano 4列在Pixel 11系列和三款Galaxy Z Flip8、Fold8机型上,Pixel 9和10手机则列在第3版之下。这个页面还提醒,不同版本的Nano对同一个提示可能给出不同的回答。

Meta和微软

Meta的Llama 3.2 1B模型卡列出12.3亿参数,发布于2024年9月25日。在一台OnePlus 12上用Meta的ExecuTorch运行时,量化版本占用1,083 MB磁盘和1,921 MB工作内存,解码速度为每秒50.2个词元。全精度版本占用2,358 MB和3,185 MB,速度为19.2。这些测试是Meta做的。tuput没有找到Meta更新的小型Llama模型。

微软的Phi-4-mini-instruct有38亿参数和128,000词元的窗口,2025年2月发布。它的模型卡报告在MMLU(一种通用知识考试)上得67.3分,在GSM8K(一组小学数学题)上得88.6分。模型卡没有给出手机内存或速度数字。

芯片,以及没有别人验证过的说法

联发科在2026年9月15日发布了Dimensity 9600 Pro。公告说,NPU 1090(神经网络处理单元,芯片中专为AI打造的部分)的预填充性能高出51%,也就是读入提示更快,每瓦词元数多55%。它还说,这颗芯片支持最高300亿参数的模型。唯一的脚注说这些指标来自“联发科实验室内的演示设备测试”,没有点出对比的基线芯片或模型。首批手机预计本季度上市。

高通在2026年9月推出了Snapdragon 8 Elite Extreme Gen 6。HotHardware 9月22日的报道给出高通的数字:NPU最多快35%,共享内存比上一代大50%,INT4预填充最多高50%。高通举的例子是一个超过300亿参数、每个词元约激活30亿的混合专家模型,HotHardware提醒,这和运行稠密的300亿参数模型不是一回事。报道点出摩托罗拉Signature 27是最早的手机之一。

独立测试

Artificial Analysis与Liquid AI合作,于2026年8月24日推出了手机基准测试。它给41个量化版本打了分,其中33个在iPhone 17 Pro上运行过,发布文章只公布了这一台设备的手机运行时间。参赛版本必须在4位或更低精度下装进8 GB,并运行在llama.cpp引擎上。

两个26亿至30亿参数的模型在五项测试的平均分上以63分并列。LFM2.5-2.6B用了8.0秒、2.3 GB,Nanbeige4.2-3B用了21.4秒、4.0 GB。两个90亿参数的模型都用了25秒以上、6.9 GB。Gemma 4 E4B是它点名的模型之一。苹果的模型和Gemini Nano不在其中。

MMLU Pro是那种通用知识考试的更难版本,谷歌的Gemma 4模型卡报告E4B得69.4%,E2B得60.0%,只说模型是在许多数据集上评测的。苹果第三代的文章没有报告任何标准基准。在苹果自己做的并排人工评分中,AFM 3 Core在45.6%的提示上更受青睐,2025年的模型是23.3%,苹果说技术报告随后发布。到10月8日,tuput没有找到。

这些模型做不到什么

苹果WWDC25的讲解说,不要把端侧模型用于数学或代码,也不要依赖它给出事实。它不知道训练日期之后的事件,还可能编造答案。微软的模型卡说,Phi-4-mini的体量限制了它能存储的事实,在英语之外也更弱。据谷歌的模型卡,Gemma 4可能陈述不正确或过时的事实。安卓的Gemini Nano页面列出了词元限制、硬件限制和“模型能力边界”,却没有给出这些限制。Artificial Analysis没有纳入智能体基准,因为小模型在上面的得分接近零。

设备上的印度语言

苹果2026年9月14日发布的支持页面,为Apple Intelligence列出16个语言条目,包括英语、日语和土耳其语,没有点出任何一种印度语言。安卓上的ML Kit摘要API支持英语、日语和韩语。Gemma 4预训练覆盖140多种语言,开箱即用地支持35种以上,不过模型卡没有列出是哪些。Meta为Llama 3.2 1B列出八种正式支持的语言,其中有印地语,其模型卡显示,基础模型在多语言MMLU上印地语得33.5分,法语得40.5分。

印度本土的选择是2026年2月14日宣布的Sarvam Edge。Sarvam的文章列出一个7,400万参数、约294 MB的语音识别器,一个2,400万参数、约60 MB的语音合成器,以及一个约1.5亿参数、334 MB的翻译模型。语音覆盖10种印度语言,翻译是这10种加英语,共110个语言对。Sarvam报告说,在Snapdragon 8 Gen 3上,语音识别在300毫秒内启动,不过文章没有公布与谷歌云对比时的词错误率。产品页面写的是22种语言,与文章的10种对不上。Sarvam云端版本的分数见语音和翻译模型,更大的推动见印度用自己的语言构建AI的努力。

印度英特尔与政府的Bhashini部门于2026年3月2日宣布了BHASHINI Vidyalekha,这是一款离线工具,能转写英语讲课并为学生翻译。它运行在英特尔Core Ultra笔记本上,不在手机上,公告也没有点出它的语言。Sarvam的产品页面说,Edge是商业产品,需联系公司获取,不是开源的。

Share
Copied!

资料来源与延伸阅读

  1. Apple Machine Learning Research: Introducing the Third Generation of Apple's Foundation Models (8 June 2026)
  2. Apple Developer: TN3193, Managing the on-device foundation model's context window (updated 31 March 2026)
  3. Apple Developer: Explore prompt design and safety for on-device foundation models (WWDC25, session 248)
  4. Apple Support: Apple Intelligence supported languages and iPhone models (published 14 September 2026)
  5. Google AI for Developers: Gemma 4 model card
  6. Google AI for Developers: Gemma 4 model overview and memory requirements
  7. Android Developers Blog: Gemma 4, the new standard for local agentic intelligence on Android (2 April 2026)
  8. Google for Developers: Overview of the ML Kit GenAI APIs (updated 7 October 2026)
  9. Google for Developers: ML Kit GenAI Summarization API (updated 7 October 2026)
  10. Android Developers: Gemini Nano and AICore (updated 8 October 2026)
  11. Hugging Face: Meta Llama-3.2-1B model card
  12. Hugging Face: Microsoft Phi-4-mini-instruct model card
  13. MediaTek: Dimensity 9600 Pro press release (15 September 2026)
  14. HotHardware: Snapdragon 8 Elite Extreme Gen 6 release coverage (22 September 2026)
  15. Artificial Analysis: Mobile phone intelligence and inference benchmarks (24 August 2026)
  16. Sarvam AI: Announcing Sarvam Edge (14 February 2026)
  17. Sarvam AI: Sarvam Edge product page
  18. IANS: Intel and Digital India BHASHINI bring offline multilingual capabilities to AI PCs (2 March 2026)

本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。

#on-device ai#small language models#gemma 4#gemini nano#apple foundation models#sarvam edge#npu#indian languages

喜欢这篇吗?下一篇也别错过。

每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。

同类更多: 人工智能
Scale的SWE-Bench Pro榜单上最好的编程智能体为61.5%,维护者拒绝了许多通过测试的修复,METR称其最新试验无法说明智能体能节省多少时间
基准测试说智能体很强。维护者、一项随机对照试验和一堆事故报告说,实际情形要窄得多。这里说明每个数字究竟测的是什么。
Sarvam以15亿美元估值融资2.34亿美元并发布两个开放模型,但政府8月公布的已发布模型名单里,没有分享28.7亿卢比获批支持的Soket AI和Gan.ai
政府2025年选定的四家初创公司里,有两家已把模型摆到了公众面前。这个领域的其余部分,是预览版、计划,以及开发者自己跑出来的分数。
2026年最高法院两项裁决推翻了建立在伪造AI引文上的命令,而印度法院用AI做翻译和转录,最高法院的AI规则草案仍未定稿
议会答复和法院记录显示,哪些AI工具已在使用,哪些仍是试点,以及法官被禁止用它们做什么。三项最高法院命令显示了虚构的判例混进去之后会怎样。
← 全部文章