2026年8月25日星期二

早报|6999起,苹果发布新款Mac mini/追觅官宣收缩探索阶段业务/「豆包工作」正式推出,可读取飞书上下文

🖥

苹果发布 M6 Mac mini 与 M5 Ultra Mac Studio,国行 6999 元起

📋

《道路交通安全法》拟大改,自动驾驶违法由车企担责

🦿

追觅收缩探索阶段业务,聚焦四大主营方向

🤖

OpenAI 将恢复 Plus 账户 Codex 的 5 小时用量窗口

🛍

SK 海力士淘宝旗舰店下架全部商品,拟于 9 月终止经营

⚠

星宇股份被曝批量劝退应届生,当地人社局通报

🚗

大众汽车酝酿史上最大重组,或再削减 5 万个岗位

🦿

智元子公司临界点在人形机器人运动会获 7 枚金牌

🚀

SpaceXAI 将采用英伟达 Vera CPU 扩展地面与轨道 AI

🤖

LinkedIn 产品负责人:用户标记正在压低 AI 低质内容曝光

🧠

美光 HBM 研究员:AI 算力增速已跑在内存带宽前面

💡

微软 CEO:企业不能把 AI 思考能力外包给单一模型

📱

vivo X500 Pro Max 预热影像防抖,新测试机曝光 5.01GHz 芯片

💻

字节跳动推出「豆包工作」,Agent 可操作虚拟桌面并读取飞书上下文

🚙

小鹏第二代 VLA 630 版升级,G9L 将首发搭载

🤖

Google 推出法律行业版 Gemini Enterprise

🔧

IBM 推出双架构主机处理器,单核原生支持 IBM Z 与 Arm

🛍

lululemon 更新 fast and free 跑步系列,增加腰部收纳与通风款式

👓

王虹同款带火林德伯格眼镜,获奖后门店咨询升温

🎮

《红色沙漠》入围 2026 科隆游戏展两项大奖

重磅

苹果发布 M6 Mac mini 与 M5 Ultra Mac Studio,国行 6999 元起

苹果 8 月 25 日正式发布新款 Mac mini 与 Mac Studio。Mac mini 提供 M6 和 M5 Pro 版本,国行起售价分别为 6999 元和 12999 元;Mac Studio 提供 M5 Max 和 M5 Ultra 版本,起售价分别为 19999 元和 46999 元。两款新品将于 8 月 27 日在中国大陆开启预购,9 月 22 日发售。

Mac mini 首发苹果首款 2 纳米制程芯片 M6,集成 12 核 CPU、12 核 GPU 和双 16 核神经网络引擎,统一内存带宽最高 170GB/s。苹果称,相较 M4 版 Mac mini,新机 AI 性能最高提升 4 倍,图形处理速度最高提升 2 倍,CPU 性能最高提升 40%。新款 Mac mini 还支持 Wi-Fi 7、蓝牙 6 和 2.5Gb 以太网。

Mac Studio 的 M5 Ultra 则首次采用四晶粒架构,最高配备 36 核 CPU、80 核 GPU、512GB 统一内存和 1.2TB/s 内存带宽。苹果称,搭载 M5 Ultra 的 Mac Studio AI 峰值计算性能较 M3 Ultra 最高提升 4.3 倍;新机还支持 Wi-Fi 7、蓝牙 6、雷雳 5 与 Genlock。

🔗 相关阅读:最全解读 | 跳涨 2500 元!苹果最新 M6 Mac mini 和 Mac Studio 怎么选?

大公司

《道路交通安全法》拟大改,自动驾驶违法由车企担责

8 月 25 日,道路交通安全法修订草案提请十四届全国人大常委会第二十四次会议初次审议。草案共 9 章 170 条,首次设置「自动驾驶汽车的特别规定」专章,区分自动驾驶汽车与辅助驾驶功能。

按照草案,车辆在自动驾驶功能激活状态下发生道路交通安全违法行为,由生产企业或进口企业接受处理;未激活自动驾驶功能,或车辆仅具备辅助驾驶功能时,仍按普通汽车规则管理。草案还覆盖上路条件、保险制度,以及「盲驾」「暴走团」和电动自行车等治理问题。

草案同时规定,未经许可,任何单位或个人不得占用道路从事非交通活动,用于处理影响通行的「暴走团」等情况。对电动自行车,草案拟调整限速规则,并要求驾驶人和乘车人按规定佩戴安全头盔。此次仍属初次审议,条文还需继续审议。

追觅收缩探索阶段业务,聚焦四大主营方向

8 月 25 日,追觅科技发布公告称,近期对部分处于探索阶段的业务进行了调整,相关技术积累、研究成果和资源将按实际需要纳入现有业务与研发体系统筹管理。

公司将后续聚焦智能家庭、户外庭院、智能出行和具身智能四大方向,并以人工智能、机器人和智能制造为主要技术驱动力。追觅表示,今年以来核心业务和海外业务仍保持增长,研发、生产、销售、交付及售后服务正常进行。

这份说明发布前,社交平台上出现了追觅大家电等业务调整的消息。追觅没有在公告中列出被收缩业务的具体名单,而是将技术和资源回收到现有体系,并用四大方向界定接下来的投入边界。

全面超越英伟达 GB200 与 GB300,OpenAI 首颗自研芯片 Jalapeño 实测出炉

OpenAI 公布首款自研推理芯片 Jalapeño 首批实测成绩,在吞吐、能效与延迟三项指标上全面超越英伟达 GB200 与 GB300。根据 OpenAI 与 SemiAnalysis 在 InferenceX 基准上的测试结果:

  • 在 GPT-OSS 120B 上,单用户出词速度达 1459 tokens/s,是 GB200 535 tokens/s 的 2.7 倍;
  • 在 DeepSeek R1 670B 上,端到端延迟 1.65 秒,对比 GB300 的 5.99 秒;以 GB300 最快解码速度为基准,每千瓦吞吐达到对方的 104.3 倍;
  • 在 Kimi K2.5 1T 上,峰值每瓦吞吐提升约 1.5 倍,延迟降低约 3.4 倍;
  • 三款模型整体每瓦 AI 工作量提升 1.5 至 1.9 倍,高交互场景性能提升 2.1 至 4.1 倍。

Jalapeño 标称功耗 700W,仅为 GB300 的一半;SemiAnalysis 估算其每芯片每小时总拥有成本约 1.56 美元,与英伟达 H100 基本持平,低于 Vera Rubin 的 3.61 美元。

OpenAI 表示,Jalapeño 从设计到流片仅用九个月,过程中借助自研模型 GPT-Astra 与 Codex 加速电路设计与验证,AI 辅助让 SIMD 单元面积减少 8%、矩阵引擎面积减少 10%;在部分注意力与 MoE 模块上,AI 生成的内核比人类专家实现快 1.5 至 1.8 倍。

去年 10 月,OpenAI 与博通签署了 10GW 定制加速器合作协议,Jalapeño 是该路线图的第一代产品,Gen 2 已在深度开发,Gen 3 正在成形。官方称将在今年年底前把 Jalapeño 部署进自有算力基础设施。

OpenAI 将恢复 Plus 账户 Codex 的 5 小时用量窗口

OpenAI 的 Codex 与 ChatGPT 产品负责人 Tibo Sottiaux 表示,公司将从 8 月 26 日起,为 Plus 账户恢复 ChatGPT Work 与 Codex 的 5 小时用量窗口限制;此前他曾预告这一调整,随后又推迟实施。

Sottiaux 写道,5 小时窗口可以平滑计算资源负载,使周用量维持相对宽松;他还表示,一些使用频率较低或刚开始使用的 Plus 用户会意外耗尽整周额度,恢复窗口限制是为了减少这类体验混乱。

未来数月,Pro 两档订阅暂不启用这层 5 小时窗口限制。Sottiaux 没有在帖文中公布 Plus 账户每个窗口的具体额度。

SK 海力士淘宝旗舰店下架全部商品,拟于 9 月终止经营

「SKhynix 旗舰店」日前在天猫首页公示,店铺拟于 9 月 9 日自主终止经营,目前已下架全部商品,用户也无法直接通过淘宝搜索到该店铺。部分消费者因此担心,已购内存产品的后续质保可能受影响。

据澎湃新闻报道,店铺公示的运营主体为天津海利士科技有限公司,记者尚未联系上该公司。淘宝和京东的多家 SK 海力士经销店表示,各店售后体系相互独立,相关产品的售后由原销售店铺负责。

天津海利士科技成立于 2020 年,经营范围包括技术服务和机械设备销售等。由于旗舰店下架时没有同步公布面向历史订单的售后承接方案,消费者关注的核心仍是终止经营后由哪个主体继续履行质保。这次变动目前只能确认为淘宝天猫店铺的终止经营公示,不等同于 SK 海力士退出中国市场。

星宇股份被曝批量劝退应届生,当地人社局通报

8 月 25 日,常州市人力资源和社会保障局通报星宇股份解聘应届毕业生事件。调查显示,公司共招录 440 名 2026 届高校毕业生,与其中 107 人解除劳动合同。

通报认为,企业在协商过程中方法简单生硬、缺乏充分有效沟通,造成不良影响。星宇股份已道歉,并对人力资源总监作出停职处理。人社部门同时确认,公司不存在违规享受就业和人才类政府补贴的情况。

当地人社部门已向涉事毕业生提供一对一就业推荐服务。截至 8 月 25 日,107 人中已有 22 人实现就业,14 人正在参加其他企业面试,其余人员将继续获得就业服务。

大众汽车酝酿史上最大重组,或再削减 5 万个岗位

据路透社与界面新闻报道,大众汽车 CEO Oliver Blume 表示,公司正在推进集团史上规模最大的转型计划,潜在措施包括在既有削减计划之外再减少约 5 万个岗位,并拆分部分业务部门,以降低管理和运营成本。

这仍是一套待协商方案。新增裁员规模、业务拆分和工厂安排需要经过监事会、工会及员工代表多轮磋商,德国工会已公开质疑相关方案。Blume 认为,汽车行业压力未来数年仍会加剧,大众需要通过更深的成本削减为电动化转型腾出资源。

大众此前还宣布精简车型和技术体系,计划最多减少一半车型,并降低产品配置复杂度。集团希望把平台、电子架构和软件开发进一步整合,同时让年产能更贴近约 900 万辆的实际需求。

智元子公司临界点在人形机器人运动会获 7 枚金牌

智元子公司临界点宣布,其 OmniHand 灵巧手在 2026 世界人形机器人运动会的 8 个灵巧手专项中全部进入决赛,最终获得 7 枚金牌、4 枚银牌和 3 枚铜牌。其中,3 个项目采用全自主操作完成。

OmniHand 以量产版本参加积木搭建、粉末称重和开瓶撬盖等不同赛项。该产品整机重 510 克,拥有 16 个自由度,支持手背触控交互;在电动工具装配项目中,团队通过外层位姿控制与内层触觉控制提高对准精度和现场环境适应性。

在与武汉大学的联合参赛项目中,团队使用 OmniHand 完成 20±0.5 克的粉末称重任务并获得冠军。公司称,OmniHand 累计出货量已超过 2 万台,沉淀了超过 5 万小时真实世界数据。

SpaceXAI 将采用英伟达 Vera CPU 扩展地面与轨道 AI

英伟达宣布,SpaceXAI 将围绕 Vera Rubin 平台扩展下一代 AI 基础设施,从地面数据中心延伸至轨道卫星。Vera CPU 将承担智能体工作流中更依赖 CPU 的任务,包括编排、工具调用、代码执行、数据处理和仿真。

同时,英伟达 Groq 3 LPX 推理机架已进入全面量产。在 Artificial Analysis 针对 Gemma 4 31B 和 10 万 Token 长上下文的测试中,系统达到每秒 3400 个输出 Token,英伟达称其速度为最接近替代方案的 4 倍。

Vera Rubin 的设计重点是让 CPU、GPU、网络和推理加速器协同工作。智能体需要频繁调用工具、执行代码和维护长上下文,英伟达希望 Vera 承接这些编排与数据处理负载,让 GPU 更多时间用于模型计算。SpaceXAI 的采用因此同时指向地面 AI 工厂和未来的轨道计算场景。

LinkedIn 产品负责人:用户标记正在压低 AI 低质内容曝光

LinkedIn 首席产品官 Hari Srinivasan 在社交媒体公开帖文中回应了平台的 AI 低质内容问题。他表示,「看起来像 AI 垃圾」反馈入口上线后,不到一个月已有超过 100 万名用户使用该功能。

平台将用户反馈与自动检测系统结合,被 LinkedIn 识别为低质 AI 内容的帖子,浏览量已比数周前下降约 40%。单次标记不会直接触发删帖,群体反馈会进入内容分发和自动检测系统。

Srinivasan 把平台问题定位为低质生成内容对真实个人经验和专业观点的挤压,并未将所有 AI 辅助写作都视为违规。他认为,LinkedIn 的价值依赖用户与真实的人建立连接,并分享个人观点、经验与专业知识。

除了降低分发,平台还开始通过私密的 Post Analytics 通知向发布者反馈。当足够多成员认为某条内容像 AI 生成时,发布者会在后台收到提示,以便调整表达方式。这套方案同时尝试处理内容分发和发布者行为,而不只是在内容上加一个 AI 标签。

美光 HBM 研究员:AI 算力增速已跑在内存带宽前面

美光 HBM 设计架构研究员 Raghu Sreeramaneni 在 Hot Chips 2026 的公开演讲中表示,「内存墙」不仅没有消失,还可能正在恶化。他给出的对比是,AI 加速器的计算性能约每两年增长 3 倍,但 HBM 带宽同期增长不到 2 倍,数据传输速度因而成为系统实际吞吐量的上限。

「内存墙」指计算单元性能提升快于内存向其供给数据的速度,导致计算单元在等待数据时空转。在大模型推理中,权重和 KV Cache 需要持续在内存与计算单元之间搬运,因此加速器的理论算力并不必然转化为同比例的实际性能。

他认为,继续堆叠计算单元无法单独解决问题,未来需要通过打破计算与存储边界的架构设计,缩短数据与计算单元之间的距离。按照这一判断,评估 AI 芯片时需要把浮点计算能力、内存带宽和数据搬运效率放在同一套指标中考察。

他给出的方向是让存储更靠近计算,并在芯片、封装和系统层同时优化数据路径。单一代 HBM 增加容量或带宽只能局部缓解瓶颈,长期方案还包括重新设计计算与存储的分工。这场发言发生在美光、三星和 SK 海力士都将 HBM 带到 Hot Chips 的背景下,内存瓶颈已成为 AI 基础设施的共同问题。

💡 微软 CEO:企业不能把 AI 思考能力外包给单一模型

微软 CEO 萨提亚·纳德拉在 CNN 对话中表示,企业使用 AI 时不仅拥有「人力资本」,还会积累由提示词上下文、员工与模型的交互记录以及使用方式组成的「Token 资本」。这些知识应留在企业内部,而不能被绑定到单一模型或服务商。

他主张企业保留每次使用模型产生的元数据,以便训练自己的权重或模型;在技术架构上,还应把应用层与模型分开,把上下文和记忆从模型中独立出来,从而能够按任务使用不同模型,即使某个模型停止服务也不失去控制。

纳德拉认为,企业若没有这类控制能力,等于把自身思考外包出去,最终可能失去作为独立公司的基础。他同时把消费者市场与企业市场区分开来:面向消费者的免费服务可以存在以数据交换价值的模式,但持续创造专有知识的企业不应照搬这一逻辑。

新产品

vivo X500 Pro Max 预热影像防抖,新测试机曝光 5.01GHz 芯片

vivo 产品经理韩伯啸继续预热 X500 Pro Max,确认该机的「蓝图光御 900」主摄采用 3 度大角度云台级防抖,防抖行程较上代翻倍,拍照防抖达到 CIPA 7.0。该传感器由 vivo 与索尼定制,官方称视频动态范围达到 17EV。

与此同时,一台型号为 vivo V2606A 的测试机出现在 Geekbench 6.7.1,单核和多核成绩分别为 3434 分与 9334 分。测试信息显示其处理器采用 2+3+3 核心结构,超大核标称峰值达到 5.01GHz,后端记录的持续运行频率约为 4.59–4.60GHz。

测试机的零售身份尚未确认,外界推测它可能属于 vivo X500 系列或 iQOO 16。现阶段可以确认的是 X500 Pro Max 的影像规格来自 vivo 官方预热,而 V2606A 与具体产品的对应关系仍需等待发布信息。

字节跳动推出「豆包工作」,Agent 可操作虚拟桌面并读取飞书上下文

字节跳动正式发布生产力 Agent 「豆包工作」。产品可根据用户目标拆解任务、调用工具并持续推进流程,支持写文档、制作表格与 PPT、生成图片和视频,以及搭建网页和简单系统。

豆包工作可在不影响本机使用的情况下操作虚拟桌面和浏览器,操作过程可见,用户可随时暂停或接管。它还能定点编辑文档、PPT、网页和应用中的具体内容。

产品与飞书深度打通后,可在权限范围内读取群聊、文档、会议纪要和多维表格,用于生成周报、客户方案、对账看板和经营分析。用户可在 doubao.com/work 下载独立电脑版,也可在最新豆包电脑版中使用。

小鹏第二代 VLA 630 版升级,G9L 将首发搭载

小鹏汽车 8 月 25 日宣布第二代 VLA 630 版完成首次模型重大升级。端侧模型参数量提高 3.5 倍,官方称其规模达到行业主流 VLA 模型的 15 倍;端到端响应速度提升 300%,主要用于改善辅助驾驶中的安全博弈和减速操作。

这套版本将由小鹏 G9L 全球首发搭载。与单纯增加模型规模同步,小鹏将响应速度和跨车型适配列为升级重点,希望模型在复杂路口、不同车型和不同国家道路环境中保持更稳定的决策表现。

小鹏计划于 8 月 27 日 15 时举行「物理 AI 分享暨第二代 VLA 全新版本体验日」,届时进一步展示 630 版的实际能力。官方同时提示,当前功能仍属于智能辅助驾驶,车辆行驶责任仍由驾驶人承担。

Google 推出法律行业版 Gemini Enterprise

Google Cloud 推出 Gemini Enterprise for Legal,面向律师事务所和企业法务部门提供定制化 AI 工作环境。该产品现已开放预览,首批参与机构包括 Cleary Gottlieb、Freshfields、Weil 和 Williams & Connolly。

平台提供合同审阅与修订、法律研究、监管变化扫描和数据访问请求处理等预置能力,并可通过 MCP 连接 iManage、NetDocuments、Docusign、Everlaw、RelativityOne 和汤森路透 HighQ 等系统。

Google 强调,这些连接会继承原有的用户权限、文档权限和保密墙;客户数据、内部操作指南、自定义智能体与模型输出不会用于训练或微调 Google 的基础模型。

IBM 推出双架构主机处理器,单核原生支持 IBM Z 与 Arm

IBM 在 Hot Chips 2026 上公布首款双架构主机处理器,面向未来的 IBM Z 和 LinuxONE 系统。每个处理器核心都能原生执行 Arm 与 IBM Z 指令,无需为两套架构分别配置专用核心。

新芯片采用 2nm 工艺,设计包含 11 个主频超过 5.7GHz 的高性能核心,并集成面向交易内欺诈检测的 AI 推理加速器、片上 I/O 数据处理单元和大容量缓存。

这套设计可让 Arm 原生 Linux 环境与 z/OS、IBM Z 上的 Linux 同时运行,将 Arm 生态中的云原生和 AI 软件引入大型机。这是 IBM 与 Arm 今年 4 月宣布合作后的首个处理器成果,目前仍属于未来产品规划。

新消费

lululemon 更新 fast and free 跑步系列,增加腰部收纳与通风款式

lululemon 8 月 25 日推出 2026 秋季跑步装备,重点更新 fast and free 系列。女士运动紧身裤减少腰部面料层数和热压结构,并新增安全拉链口袋与隐藏式插袋;新款女士运动背心内置 Incognito 胸垫,可不额外搭配运动内衣。

系列同时增加男士运动五分紧身裤,采用 Nulux 面料和裆部网面设计,腰部圈绳可固定跑动中脱下的上衣。fast and free airflow 系列则通过分区通风和减少缝线改善炎热天气下的透气性,提供背心与短裤款式。

本季产品已在 lululemon 门店和官方小程序销售,配色包括钴蓝、粉色和树莓紫。此次更新集中在跑步中的收纳、支撑和通风,没有改变 fast and free 系列的轻量化定位。

王虹同款带火林德伯格眼镜,获奖后门店咨询升温

菲尔兹奖得主王虹佩戴的黑框眼镜近日在社交平台引发讨论。中国新闻周刊援引「有意思报告」求证称,这副眼镜来自丹麦高端眼镜品牌 LINDBERG,经销商表示同款单镜架售价在 4000 元以上。

经销商称,王虹获奖后,相关门店咨询量明显上升,但实际成交仍以原本重视轻量化材质和定制验配的消费群体为主。由于镜架价格门槛较高,且是否适合脸型需要到店试戴,社交平台热度没有直接转化为大规模成交。

LINDBERG 主打无螺丝结构、钛金属和个性化定制,2021 年被开云集团旗下开云眼镜全资收购。王虹同款带来的关注,让这一原本面向小众高端客群的品牌进入更广泛的消费讨论。

《红色沙漠》入围 2026 科隆游戏展两项大奖

科隆游戏展公布 2026 年 gamescom awards 入围名单,Pearl Abyss 开放世界动作冒险游戏《红色沙漠》获得「Most Epic」和「Best PC Game」两项提名。入围名单先由国际游戏媒体和内容创作者组成的评审团选出,最终结果将结合评审与观众投票产生。

《红色沙漠》以无缝开放世界「Pywel」为舞台,讲述主角 Kliff 与「Greymanes」伙伴的旅程,支持 PlayStation 5、Xbox Series X|S、Steam、Mac 和 Epic Games Store。

Pearl Abyss 将在 8 月 26 日至 30 日与三星参加科隆游戏展,现场设置 30 台试玩 PC,并使用 Odyssey G8 等设备展示游戏。观众投票从 8 月 26 日开始,获奖结果将在 8 月 28 日公布。

好看的

《十日拍拖手册》续集启动开发,凯特·哈德森担任制片人

据《综艺》报道,派拉蒙已开始开发《十日拍拖手册》续集,原版主演凯特·哈德森将担任制片人,Stacey Sher 也将参与制作。片方希望哈德森与马修·麦康纳重新饰演 Andie 和 Benjamin,但项目尚在早期阶段,正在寻找编剧,演员阵容和其他核心主创尚未确定。

2003 年上映的原版由 Donald Petrie 执导,讲述杂志专栏作家 Andie 和广告人 Benjamin 在各自任务驱动下开始恋爱的故事。影片当年全球票房接近 1.8 亿美元,此后成为 2000 年代初代表性浪漫喜剧之一。

哈德森此次以制片人身份加入,让她重回出演的可能性明显提高;麦康纳是否回归尚未确定。当前没有定档日期,片名和剧情也尚未公布,项目的确定进展是派拉蒙已启动开发并组建制片团队。

《温蒂·威廉姆斯秀》纪录片定档 Peacock

Peacock 宣布制作三集纪录片《Clap If You Care: The Wendy Williams Show》(暂定名),计划于 2027 年上线。该片将回顾温蒂·威廉姆斯从电台主持人到日间谈话节目主持人的职业轨迹,并重新梳理她离开节目的过程。

《温蒂·威廉姆斯秀》于 2008 年开播,共播出 13 季。节目将明星八卦、时事话题和主持人的鲜明风格结合,对美国日间谈话节目形态产生了持续影响。

纪录片将采用节目档案素材和与幕后团队有关的叙事,关注这档节目如何建立属于威廉姆斯的主持语言,以及节目在她健康问题和长期缺席后走向结束的过程。与聚焦威廉姆斯个人健康与监护权争议的既有作品不同,这个三集项目的主体是她的日间谈话节目及其制作史。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/tW8OXBm
via IFTTT

2026年8月24日星期一

实测小米 AI 手机:性能超 iPhone,端侧 AI 超级快

昨天,小米一口气发布了玄戒 O3、O100 和 D100 三颗全新自研芯片。我们昨天已经详细拆解过它们的纸面规格

无论是 O3 Geekbench 6.5 多核破 1.5 万分的 CPU 成绩,还是 O100 身上通过 3D 堆叠压榨出的 1.22 TB/s 超高带宽,就纸面数据而言,提升确实非常激进。

Image

但大伙儿心里难免也会打个问号:离开实验室和跑分软件,这些芯片在真实设备里的实际表现到底怎么样?

这次,我们在技术沟通会的现场,体验到了两台搭载全新芯片的工程原型机。

一台是背面加装了主动散热风扇、在断网状态下本地运行大模型的折叠屏原型机;另一台则是打满散热孔、直接在本地跑 120B 大模型的桌面计算终端 AI Cube。

这三颗芯片装进硬件后都有哪些能耐,我们在现场找到了答案。

把风扇塞进折叠屏,本地大模型学会了「秒回」

我们首先体验到的是玄戒 O100 原型机。

这台设备的整体形态类似一台折叠屏手机,但背面并没有常规的多摄模组,取而代之的是一整块金属工程结构件。上方开着圆形的进出风格栅,里面还塞了一颗主动散热风扇。

Image

翻到正面,展开的大尺寸内屏上运行着测试工具 XRING LAB。而当我们尝试退出这个测试软件后,底层跑的就是大家熟悉的常规澎湃 OS。

Image

在现场演示中,这台折叠屏在断网状态下本地运行小米 MiMo 3B 模型。我们在输入框敲入一段复杂的提示词,XRING LAB 底部显示的响应延迟(TTFT)只有 0.45 秒左右。

实测生成速度能达到 303 tokens/s,峰值甚至能冲到 330 tokens/s,还没反应过来,回答就已经铺满了屏幕。

Image

对于端侧 AI 来说,生成速度直接决定了它在日常生活中到底能不能派上用场。

从实际表现上看,这台小米 AI手机的「原型机」,对于 AI 回答的生成速度已经快过人眼的阅读节奏,无论是复杂文档的即时润色,还是通话过程中的同声传译,AI 都能做到即问即答的跟手体验,同时还能守住完全不依赖网络、数据不出本地的隐私底线。

这也是未来端侧 AI 设备的一大卖点。

小米 AI 电脑原型机,让大模型在本地写代码

看完掌上的折叠屏,再来看看展台旁边这台充满硬核工业风的黑色「方盒子」——Xiaomi AI Cube「Prototype」。

Image

整机由一整块航空铝 CNC 一体成型打造。

为了压制内部核心的高负载发热,机身四周密密麻麻开凿了整整 33874 个精密镂空孔,腰线处嵌入了一条低调的环形灯带,底部则排布着一整圈整齐的横向散热鳍片。

这台设备内置了 80 GB 内存(芯片最高可支持 160 GB),运行的是 Android 系统,并在本地直接部署了 120B 参数的大模型。

现场工作人员输入了一段需求,要求模型生成一个钢琴网页,左侧的任务列表迅速开始解析,右侧随后刷出大段前端代码。

不一会儿,屏幕上直接运行起一个功能完整的「Web Audio 在线钢琴」应用,上方有实时音频波形与控制滑块,下方的黑白琴键用手指点击就能即时发声。

Image

AI Cube 还支持 3B + 120B 的快慢双模型切换。轻量的高频指令由 3B 小模型秒回,真正需要深度推理的代码生成才交给 120B 接管。简单问题不用等,遇到复杂的 Coding 任务时,桌上的这台方盒子也完全能胜任。

Image

对于有本地计算需求的用户来说,小模型推理飞快但容易在复杂任务上「胡乱发挥」,而聪明的千亿级大模型门槛又高得吓人。

这台「方盒子」在办公桌上找到了平衡点:既有小模型随时待命的轻快,又有千亿大模型扎实的逻辑底力,把以往需要专业工作站才能做的事情,变成了一件触手可及的桌面工具。

展台上的这两台设备,展示了工程团队探索端侧算力的两个具体方向。

一台在折叠屏有限的机身里,依靠专用加速芯片拉满内存带宽,跑出了完全离线的即时交互;另一台则借助放开的桌面空间与多芯片协同,在本地稳定运行 120B 的代码生成。

随身设备负责轻量高频的「秒回」,桌面终端承接重度复杂的推理,不同尺寸的硬件各自有了明确的分工。

Image

无论是背着风扇的折叠屏,还是打满散热孔的 AI Cube,现场这两台机器展现出的离线 AI 能力,都让人看到了端侧硬件的扎实底力。

离线即时响应和本地代码生成,已经变成了看得见、摸得着的真实体验。

或许我们也可以期待一下,小米未来能真正量产「年轻人的第一台 AI 算力中枢」,让每个人都能低门槛在本地跑起属于自己的大模型。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/iI4xHr3
via IFTTT