Artificial Analysis 于 8 月 24 日发布博文,宣布携手 Liquid AI,发布面向手机端的 AI 跑分基准,重点关注 AI 模型在苹果 iPhone 17 Pro 上的表现。这一时间点标志着业界对移动端本地大模型性能评估进入了一个新的阶段。
本次测试的范围和深度是其核心特征。Artificial Analysis 和 Liquid AI 双方选用了 BFCL(Berkeley 函数调用排行榜)、IFBench(指令遵循测试)、AA-Omniscience(知识与认知相关测试)、GPQA Diamond(高难度问答测试)和 MATH-500(数学问题测试)这 5 项基准测试。这些多维度的测试组合,旨在全面衡量模型在不同认知任务上的能力。
值得注意的是,本次测试的模型对象被严格限定为 4 bit 量化后体积不超过 8GB 的模型,示例包括 Gemma 4 E2B 和 LFM2-2.6B-Exp。这种对模型大小的限制,直接模拟了在资源受限的移动设备上实际部署时的场景。
从性能表现来看,当上下文长度限制为 16K tokens 后,平均基准测试得分最高的是 Nanbeige4.2-3B 和 LFM2.5-2.6B。这表明在处理长文本理解和推理任务时,这两款模型展现出了领先的综合能力。
如果将关注点放在响应速度上,即当响应时间限制为最长 1 分钟时,LFM2.5-8B-A1B 排名第 1。紧随其后的是 LFM2-2.6B-Exp、Gemma 4 E4B(Non-reasoning)和 Granite 4.1 8B。
在模型背景信息方面,Nanbeige4.2-3B 是 BOSS 直聘旗下的南北阁实验室推出,其特点是仅含 30 亿非嵌入参数(总参数约 40 亿),并且采用了 Looped Transformer 架构。有公开资料指出,“Nanbeige4.2-3B”的基准测试得分与“LFM2.5-2.6B”相当,这为用户提供了参考点。
从时间线和背景分析来看,Artificial Analysis 选择发布这一报告,反映了当前业界对端侧 AI 算力瓶颈日益关注的趋势。以往的模型评估可能更侧重于云端或特定硬件环境下的峰值性能,而本次测试明确将焦点锁定在“8GB 以内”的本地部署限制上。
读者可以理解为,此次报告提供了一个可追溯的、基于多项硬性指标(如上下文长度和响应时间)的参考框架。它帮助用户了解在特定资源约束下,不同架构和参数规模的模型之间的实际性能权衡。
需要强调的是,本次分析结果完全来源于 Artificial Analysis 于 8 月 24 日发布的博文,所有结论均基于该单一来源的测试数据,不应被视为行业内所有模型的最终定论或普遍适用标准。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。