2026年8月22日星期六

Windows 是 AI PC 路上的绊脚石

微软近期做了一件看起来相当反常的事。

它开始重新优化 Windows 在 8GB 及以上设备上的内存表现。

图自 Windows Blog

放在几年前,这基本算是做梦。

毕竟按照当年「安迪给的,比尔拿走」定律来看,一直是硬件规格有多高, Windows 就吃掉多少——8GB 早就被当成入门配置扫进了历史的角落,微软主推的 Windows 11 AI+ PC,也从一开始就把内存门槛定在了 16GB。

可现实上演了一出回马枪。

AI 的爆发让数据中心疯狂囤积内存,颗粒价格一路上涨,成本压力顺着供应链传到每一台 PC 上。

而那个被无数 Windows 用户抱怨的问题,再次摆到了台面上:

臃肿的 Windows,是不是 AI PC 路上的绊脚石?

吞掉右 Ctrl 的 Copilot 键

傲慢|你一直在给 Windows 擦屁股

Windows 长久以来存在的最大误判,就是默认处理器会越来越快,内存不够用户自然会加,再不济就换台新电脑。

在这套逻辑下,Windows 对自身的内存开销比较宽容。后台服务和框架越积越多,内存占用也跟着上涨,反正更强的硬件总能把这些问题暂时盖过去。

但 AI 出现以后,多出来的硬件资源不再只属于传统应用。

过去新增的内存能让浏览器多开几十个标签页,现在越来越多本地 AI 功能还要加载模型、维护索引,并持续处理来自屏幕和摄像头的数据。

Windows 那些曾经无关痛痒的基础开销,也开始直接挤压 AI 的运行空间。

微软直到此时才重新审视 8GB 设备,更像是硬件增长已经无法继续替系统掩盖浪费。

暴食|没有节制的加法就是负担

硬件长期承担善后,也养出了 Windows 不断做加法的习惯。

微软此次优化的对象横跨内存分配器、WinUI 3、Chromium 和 WebView2,从底层资源分配一直延伸到界面框架和网页运行环境。

可问题早已超出某个单独组件,更像是整套系统长期缺少统一资源约束后的结果。

图自 DotNetBrowser

单独拎出来看,每一层都有自己的正当理由。WinUI 3 是为了现代化的界面体验,Chromium 是为了网页兼容和开发一致性,旧框架是为了让历史应用和企业软件继续跑下去。

麻烦在于每一层都「存在即合理」,又缺少统一的收缩机制去约束,于是各层在各自的目标下不断扩张,最后叠加成整个系统的负担。

传统 PC 还能靠硬件升级稀释冗余,但 AI PC 要把大量内存留给模型权重、上下文和常驻 Agent。

微软如今重新优化 8GB 设备,也说明 Windows 的基础开销仍有不小的压缩空间,只是过去没有足够大的压力推动微软处理。

懒惰|兼容,Windows 最重的包袱

如果说暴食来自不断增加功能,懒惰则体现在旧东西几乎不怎么「打理」。

Windows 主打兼容性优先,这也导致旧接口和运行环境退出得很慢,新旧体系时常并存。

为了兼容几十年前的软件或企业系统,甚至是特殊外设的驱动,Windows 都保留了好几套不同年代的接口与运行环境。

这套兼容性确实是它最重要的生态地基,让大量行业系统几十年都能跑在同一个平台上。

但兼容能力后来逐渐变成了一项没有明确边界的义务。

最经典的例子就是控制面板至今没有被新设置完全取代,很多功能只能让两套入口长期并存。

部分界面的入口看似越来越现代,但一旦深挖几层,照样能翻出十几年前的逻辑和窗口体系。

图自 Tom’s Guide

Windows 的懒惰不在于它什么都没做,恰恰相反,它做了太多加法,却始终不愿承担做减法的代价。

传统桌面环境还能容忍这种结构,可 AI PC 还要处理 CPU、GPU 与 NPU 之间更频繁的任务调度,同时为本地模型和后台 AI 功能分配资源。

旧规则保留得越多,统一管理的难度就越高。

贪婪|甩不掉的微软全家桶

Windows 的臃肿也不能全部归咎于历史兼容。

今天的 Windows 早已不是一套操作系统,更像是微软账户带着 Edge 和 OneDrive,再拉上 Microsoft 365 与 Xbox 一起挤进来的全家桶入口。

这些组件既承担具体功能,也关乎着微软在系统生态的分发入口。因此是否能够彻底移除,自然不只是一个技术问题。

不仅如此,OEM 厂商还要在这层基础上继续「装修」,从更新工具到电源管理,到驱动面板和各类预装软件,能加进系统的通通给你满上,主打一个「加加加加到厌倦」。

联想桌面助手

于是就形成了一个解不开的死结:历史兼容让旧东西搬不走,商业扩张又让新模块不断住进来,系统只能持续膨胀。

微软若想让 AI Agent 成为统一的任务入口,来负责调动应用和系统能力,就得先处理 Windows 内部大量彼此独立的服务与权限体系。

依赖|技术捷径是最大的拖累

让 Windows 变沉的,还有微软越来越依赖的网页技术。

Windows 不少更新的功能都一定程度上使用了 WebView2。

而 WebView2 使用基于 Chromium 的 Microsoft Edge 渲染引擎,让开发团队能够复用 HTML、CSS 和 JavaScript,以此降低界面开发成本,也方便快速更新。

工程效率是提高了,资源纪律却没有同步跟上

图自 Windows Latest

WebView2 的运行时本身可以由多个应用共享,但不同应用仍可能各自建立浏览器进程、渲染进程、页面状态和用户数据环境。

应用数量增加后,这些彼此隔离的活动进程仍会叠加内存与后台开销。

微软持续优化 Chromium 和 WebView2 的内存与启动成本,已经说明问题不能只归咎于某个应用写得差,更需要思考如何统一和规范分散的资源使用方式。

嫉妒|什么都想要,什么都不行

微软当然也希望 Windows 能像 macOS 一样,把处理器、系统、开发工具和应用生态,都打包进同一套协同体验里,更希望 AI+ PC 能拿出接近 MacBook 的软硬件配合。

Windows 却很难照搬苹果的路线。

图自 Tom’s Guide

苹果能够控制硬件型号数量,同时统一产品的处理器架构和开发工具,甚至敢给旧架构设定明确的退出时间。

微软可以通过 Prism 承接传统 x86 和 x64 应用,但驱动与内核组件仍然需要原生 Arm64 支持。

换而言之,应用能够依靠转译过渡,特殊硬件却依然取决于厂商是否愿意重新开发驱动。

微软既想获得新平台的协同效率,又不愿放弃开放生态、历史兼容和市场规模,最终只能同时承担两套模式的成本。

长期犹豫也在削弱 Windows 曾经近乎垄断的优势。

2021 年前后,Windows 在 StatCounter 全球桌面网页使用统计中的份额仍接近八成;到 2026 年 7 月,这个数字已经降至 71.18%。

2021 年(上)、近 12 个月(下)

以 StatCounter 的统计来看,Windows 仍有领先的地位,但友商的平台优势也在变强。

苹果通过推动整条 Mac 产品线统一转向 M 系列芯片,完成了新一代硬件架构的迁移;而 Linux 则在开发工具和 AI 计算上继续扩张,并逐渐渗透到更多跨架构环境中。

Windows 每次在新架构和旧生态之间反复权衡,都会拉长自身迁移周期,也给其他平台留下吸引用户和开发者的时间。

迁怒|优化做不好,就让内存买单

面对系统膨胀,微软过去最常见的处理方式,是提高硬件门槛。

8GB 不够就推动 16GB,游戏和多任务吃紧就建议 32GB,ARM 兼容不完善就依靠更强的处理器和更高效的转译弥补。

今年 4 月,微软还在 Windows Learning Center 的游戏 PC 指南中,把 16GB 称为实际起点,并把 32GB 称为更省心的升级选择。

这篇文章随后在 5 月初被删除;到了 8 月,另一篇把 32GB 称为重度玩家理想配置的旧指南,也被确认已经下线。

微软没有解释原因,可调整时间却很微妙。

图自 Windows Latest

提高配置看起来顺理成章,但成本却要由 OEM 厂商和消费者承担。

AI 浪潮推高内存需求后,依赖硬件升级解决软件问题的方式开始不起效了。

因为消费者花同样的钱,或许只能买到内存更小的电脑,微软也无法继续假设所有性能问题都能靠堆配置解决。

在这样的背景下,系统层面的优化已不再是技术选择,更来自现实压力。

微软愿意处理 Windows 的资源问题,当然值得肯定。但现在仍然无法确定,它准备真正移走多少历史负担,又有多少只是重新整理,好给 AI+ PC 腾出有限的运行空间。

回头看,Windows 的七宗罪最终争夺的都是同一批资源:

内存、功耗、后台权限、开发资源,以及操作系统对整台电脑的控制权。

传统 PC 可以依靠更大的内存和更快的处理器,把很多系统层面的浪费「稀释」掉。

但 AI PC 的逻辑完全不同。

模型需要驻留内存,持续维护上下文状态,还要在 CPU、GPU 和 NPU 之间频繁调度数据流。系统资源已经从随用随取的弹性池,转向被精确分配的常驻空间。

在这种结构下,系统自身哪怕多出一点基础开销,都会直接挤压 AI 的可用空间。

图自 How-To Geek

但问题的关键在于,Windows 并没有一条可以「推倒重来」的路径。

它必须在不破坏旧生态的前提下推进现代化改造——既要维持数十年积累的应用与驱动体系,又要承接本地模型、AI Agent 和跨处理器调度带来的新资源需求。

在双重约束下,Windows 的资源控制和平台迁移都不可避免地变得缓慢而保守。

相比之下,其他操作系统同样有自己的历史包袱和生态限制,但很少有一个平台像 Windows 这样,同时承载如此复杂的历史兼容体系,开放硬件生态,商业分发入口,以及跨代架构迁移压力。

当这些因素叠加在一起时,问题就不再是「优化得够不够好」,而是系统本身是否还能以足够快的速度,适应 AI PC 这种全新的计算范式。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/c9Qs72b
via IFTTT

2026年8月21日星期五

早报|摄像头AirPods或配备拍摄指示灯/问界儿童车售价1.58万元/LV否认「起诉国家知识产权局遭驳回」

🎨

GPT Image 2 API 开始预览透明背景生成

🤖

DeepSeek 上线 V4-Flash-Vision-Exp 多模态视觉理解模型

⚠

9 家车企因应急机械拉手隐患召回约 427.6 万辆汽车

☁

阿里二季度重组电商与 AI 业务架构

💻

腾讯芯片负责人高剑林被曝离职创业,瞄准 RISC-V AI CPU

📋

旺旺被曝启动裁员,并要求员工提交自评报告

🛍

LV 否认「起诉国家知识产权局遭驳回」

💰

泡泡玛特拟在半年内回购股份

🚀

奇瑞旗下 AiMOGA 筹备 IPO,明年目标交付 1 万台机器人

💻

AMD x86 客户端 CPU 出货份额首次突破 30%

💡

李彦宏:文心大模型要重回基础模型第一梯队

🦿

雷鸟 iO 发布:34g、双目显示,首发 1996 元起

🤖

小红书开源 dots3-note preview,支持 512K 多模态上下文

💳

百度秒哒接入支付宝支付 Skill

💻

豆包工作任务加入技能、连接器和专业 Agent

🔧

商汤开源 SenseNova U1.5 正式版,原生支持 4K 图像生成

🤖

DeepSeek Harness 新增 Codex 与 Claude Code 子代理接口

🚙

同程旅行完成收购嘀嗒出行,后者保持独立运营

🌐

曝 YouTube 向头部创作者支付独占费用,阻止节目同步给 Netflix

📰 周末也值得一看的新闻

带摄像头 AirPods 更多参数曝光,或配备拍摄指示灯

据 MacRumors 报道,苹果带摄像头的 AirPods 曝光更多参数,左右耳机或各配备一枚摄像头,可采集同步彩色静态图像,供 Visual Intelligence 分析,但目前不支持视频录制。

代码显示,该产品在主动模式下可采集 640 × 640 图像,并输出 1024 × 1024 处理结果;被动模式下则采集 320 × 320 图像,输出分辨率为 320 × 320 或 512 × 512。被动模式可能用于感知附近语音、环境音变化、头部转动和周围移动等情况。

相关框架还包含镜头畸变校正、双摄像头校准,以及摄像头与运动传感器校准功能,并支持在设备端判断画面中是否有人。代码同时提到硬件指示灯及亮度控制,暗示 AirPods 可能配备拍摄指示灯,用于提示周围人员设备正在采集图像。

目前曝光信息尚不能确认最终产品规格。此前曝光的 B790 版本据称已取消,苹果转而开发代号为 B798 的新一代摄像头 AirPods,预计明年推出。

GPT Image 2 API 开始预览透明背景生成

OpenAI 8 月 21 日宣布,GPT Image 2 API 开始预览透明背景生成功能。开发者可直接生成能叠加到不同背景上的可复用素材,用于产品图片、平面设计、网站原型和营销内容。

这项更新补上了 GPT Image 2 此前在 API 中不支持透明背景的能力缺口。官方模型页面显示,GPT Image 2 可通过图像生成与图像编辑端点使用,并支持灵活的图像尺寸和高保真图像输入。

同日,LMArena 上出现名为 luna-lisa-alpha 的匿名图像模型,部分测试者猜测它可能与 OpenAI 的下一代图像模型有关;OpenAI 尚未确认该模型身份,因此现阶段不能将其视为 GPT Image 2.5 的正式预告。

DeepSeek 上线 V4-Flash-Vision-Exp 多模态视觉理解模型

昨天,DeepSeek 上线实验性视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并将其开放至 API 平台。用户可通过 deepseek-v4-flash-vision-exp 模型名调用;官方称,其纯文本 Agent、推理与知识能力与 V4-Flash 正式版基本持平,同时补上图像理解能力。

官方公布的 4 项多模态 Agent 评测中,该模型在 Agents’ Last Exam 和 ZeroBench 上高于 Opus 4.8,在 ApexBench 与 Chartography 上略低。上述成绩均来自厂商测试,测试所用的 Agent 框架和任务设置也由官方给出。

API 支持 Chat Completions、Messages 和 Responses 三种调用格式,可接收 base64、外部 URL 与 Files API 三种图像输入。一张图片最多转换为 384 个 token,计费价格与 V4-Flash 相同。同步开放的 Files API 不收取存储费用,同一图片上传后可通过 file_id 跨请求复用。

9 家车企因应急机械拉手隐患召回约 427.6 万辆汽车

昨天,特斯拉、小米、小鹏、吉利、零跑、奇瑞、东风、北汽蓝谷和一汽向国家市场监督管理总局备案召回计划,涉及约 427.6 万辆汽车。主要问题是车内应急机械拉手与内饰颜色接近、不易识别和操作,严重碰撞导致低压系统失效时,可能影响乘员逃生和车外救援。

特斯拉涉及约 297.6 万辆国产及进口 Model 3、Model Y、Model X 和 Model S,是本轮规模最大的一家;小米涉及约 39 万辆 SU7,零跑涉及约 37.1 万辆 C01 和 C11,小鹏涉及约 26.5 万辆 G6、P7+ 和 X9。其余召回车型包括极氪 007、极氪 X、iCAR 03、风云 X3、纳米 06、风神 L8、eπ007、eπ008、极狐考拉、红旗 EH7 和天工 08。

各车企将按车型加贴或更换提示标识,部分车型还会通过 OTA 优化事故后降窗、中控解锁等策略。小鹏、一汽部分车型仅加贴标识,奇瑞则会同时更换改进后的应急机械拉手盖板。

隐藏式电子门把手由特斯拉带动普及,车辆断电后如果应急机械释放装置位置不清晰,可能增加逃生和救援难度。中国已决定从 2027 年起禁止隐藏式车门外把手;美国监管机构正在研究适用于所有车企的新安全标准,联合国欧洲经济委员会也在起草断电后仍能从车内外开启车门的相关标准。

阿里二季度重组电商与 AI 业务架构

阿里巴巴公布截至 6 月 30 日的季度业绩,收入为 2689.53 亿元,净利润为 104.44 亿元。公司把利润下滑主要归因于经营利润减少、处置投资收益和股权投资公允价值变动收益下降。

本季度阿里同步调整业务架构:国内与国际电商、盒马及菜鸟部分商业业务并入阿里电商集团;云智能集团与平头哥合并为「AI 云与计算服务」;模型实验室、千问消费者业务、QwenWork 则组成「AI 实验室与应用」。

AI 云与计算服务季度收入为 484.37 亿元,AI 相关产品收入连续第 12 个季度实现三位数增长。阿里本季度资本开支增至 676.78 亿元,主要用于扩充 AI 基础设施。

腾讯芯片负责人高剑林被曝离职创业,瞄准 RISC-V AI CPU

据「半导体行业观察」报道,腾讯芯片研发负责人高剑林近期离职,计划围绕高性能 AI 服务器和 Agentic AI 创业,研发基于 RISC-V 架构的高性能 CPU。报道援引知情人士称,他在腾讯负责的方向覆盖 AI 加速、CPU、RISC-V 架构、芯片验证和后端团队。

高剑林 2013 年在腾讯发起组建硬件团队,随后推动 FPGA 云服务器、AI 芯片和 RISC-V 核心研发。2020 年腾讯成立蓬莱实验室后,其团队完成腾讯首颗 TPU 架构 AI 芯片回片,并在数据中心部署后续芯片。

这次创业目前仍属于媒体独家消息,腾讯与高剑林尚未公开披露新公司的名称、融资或产品发布时间。

旺旺被曝启动裁员,并要求员工提交自评报告

据财新报道,中国旺旺近期启动裁员。多名接近公司的人士称,一名离职员工听说集团计划裁员约 1000 人、目前已裁约 400 人;另一名离职员工称,其所在部门计划优化 8% 的员工。中国旺旺在报道刊发前未回复问询。

多名员工还称,公司要求总部全体人员围绕过去一年的实际结果提交自评报告,由直属和隔级主管逐项评分,但单位最高主管无需参加。自评要求员工以事实和数据剖析不足。

这项调整延续了董事长蔡衍明本月初内部信释放的信号。蔡衍明此前称公司遭遇「重大经营危机」,要求淘汰没有贡献的干部,并调整长期未变的经销商合作方式。

LV 否认「起诉国家知识产权局遭驳回」

第一财经 8 月 21 日报道,针对「LV 起诉国家知识产权局遭法院驳回」的消息,LV 内部知情人士回应称,相关说法不实,案件仍处于法定程序中,尚未形成最终结论。

这起商标行政纠纷围绕一枚四瓣花图形商标展开。LV 此前主张广东汕头个体户黄民耀注册的图形与其商标近似,并向国家知识产权局申请宣告无效;国家知识产权局审查后认为两者细节差异较大、普通消费者不易混淆,维持了该商标注册,LV 随后提起行政诉讼。

LV 表示,该案属于围绕具体商标行政决定展开的正常法律程序,公司不对仍在进行的案件作进一步评论。

泡泡玛特拟在半年内回购股份

泡泡玛特发布上半年业绩后,创始人兼董事长王宁在业绩会上表示,公司计划在未来 6 个月内回购不低于 20 亿元、不高于 50 亿元的股份。他同时称,今年大概率无法完成年初提出的营收增长目标,下半年经营压力高于上半年。

公司上半年收入为 171.7 亿元,经调整净利润为 51.6 亿元。王宁将今年定位为经营调整年,表示提升销售额不是当前首要目标。

泡泡玛特称,THE MONSTERS、TWINKLE TWINKLE、CRYBABY 等多个 IP 均形成规模化收入,IP 组合较此前更分散。

奇瑞旗下 AiMOGA 筹备 IPO,明年目标交付 1 万台机器人

据路透社报道,奇瑞汽车旗下机器人公司 AiMOGA 正与多个潜在上市地沟通,希望通过 IPO 为后续技术投资筹集资金。AiMOGA 随后表示,公司尚未就 IPO 采取任何实质行动;奇瑞目前持有其近 77% 股权。

AiMOGA 负责人、奇瑞国际总裁张贵兵表示,公司自 2025 年 1 月孵化以来,已在全球交付超过 3000 台机器人,其中 2000 台交付至海外,覆盖 60 多个国家和地区;明年的全球交付目标为 1 万台。

公司早期把双足人形机器人投入奇瑞展厅,目前正扩展至交通管理、人群引导和公共安全宣传等场景,已有 110 台警务机器人在中国多个城市部署。张贵兵称,中东和东南亚的高温、强降雨环境可能带来更强的公共服务机器人需求。

AMD x86 客户端 CPU 出货份额首次突破 30%

Mercury Research 最新数据表明,今年第二季度,AMD 在 x86 客户端 CPU 市场的出货份额升至 30.3%,首次跨过 30% 门槛;英特尔份额为 69.7%。AMD 上一季度份额为 29.6%,去年同期为 23.9%,一年提高了 6.4 个百分点。

这项统计覆盖台式机和笔记本电脑处理器的供应链出货量,不代表终端设备保有量,也不包含 Apple Silicon、高通 Snapdragon 等 Arm 处理器。AMD 的本季度增量同时来自台式机与移动处理器。

Mercury Research 称,第二季度 x86 与 Arm CPU 总出货量环比增长超过 10%,明显高于通常的季节性表现;另一家研究机构 Jon Peddie Research 认为,部分增长来自电脑厂商在英特尔第一季度供应受限后重建库存。

💡 李彦宏:文心大模型要重回基础模型第一梯队

百度董事长兼 CEO 李彦宏在二季度业绩电话会上表示,文心大模型要重新回到基础大模型第一梯队。他承认百度在探索过程中出现过试错,但称公司不会改变让文心具备核心竞争力的承诺。

李彦宏把长期竞争力归结为持续稳定的技术投入、以应用落地为导向的产品策略和耐心。他表示,百度不会同时铺开所有场景,而会集中资源推进 AI 搜索、数字人和秒哒等生态内重点方向,并加快文心迭代。

百度官方材料显示,二季度 AI 驱动业务收入已占一般性业务收入的一半,AI 云基础设施与文库、网盘的 AI 用户渗透率继续增长。

李彦宏作出这一判断的背景,是基础模型竞争格局仍在快速变化,百度此前未能持续保持领先。他提出的推进方案包括引进人工智能人才、维持研发投入,并把有限资源集中到百度已有产品和分发能力能够承接的场景,而不是同时扩张所有应用方向。

雷鸟 iO 发布:34g、双目显示,首发 1996 元起

雷鸟创新 8 月 21 日发布 AI 眼镜雷鸟 iO,正式售价 2499 元,首发到手价 1996 元起,即日起在京东、天猫、抖音及线下眼镜渠道开售,并提供 0 至 1000 度近视配镜方案。

雷鸟 iO 采用双目显示架构,等效 33 英寸画面,入眼亮度为 1800 尼特;整机最低重量 34g,支持两天日常续航和 18 小时连续记录。交互上配有 Smart Crown 旋钮,并支持点头确认、摇头取消。

这款眼镜不配备摄像头,主要通过 4 颗阵列麦克风和 1 颗骨传导麦克风处理会议记录、实时翻译和提词。录音、翻译等功能启用时,镜腿隐私状态灯会同步亮起且不能通过软件关闭;翻译覆盖 55 种语言和 109 种口音。

小红书开源 dots3-note preview,支持 512K 多模态上下文

小红书 dots studio 开源 dots3-note preview,并在 dots.ai 开放平台提供 API 限时免费调用。它是 dots3 系列首个开放权重模型,采用混合专家架构,总参数量为 2800 亿,推理时激活 160 亿参数,最长支持 512K token 上下文。

模型可同时接收文本、图像、视频和音频,输出文本,主要面向知识问答、数学与逻辑推理、代码生成、工具调用、多步 Agent 工作流和长上下文处理。官方提供 BF16 与 FP8 权重,并给出 SGLang、vLLM 两种部署路径。

官方建议 FP8 版本部署在单台 8 卡 GPU 服务器上;vLLM 的原生支持目前位于主分支,稳定版尚未包含这一适配。

百度秒哒接入支付宝支付 Skill

昨天,支付宝宣布,百度旗下无代码应用生成平台秒哒已接入支付宝支付 Skill。开发者在秒哒创建或修改网页应用时,可直接要求 Agent 加入支付宝收款能力,不必自行编写支付接口代码。

该 Skill 默认提供不涉及真实资金的沙箱环境,完成测试后,开发者仍需在支付宝 AI 付站点申请开通网页应用收款、配置应用密钥,才能切换至线上环境。接入范围包括电商店铺、付费课程、活动报名和咨询服务等网页应用。

支付宝表示,TRAE SOLO、扣子编程、Qoder 和百度秒哒目前均已接入这一能力。对个人开发者而言,付款结果可自动回传到应用,用于即时开通额度或交付数字服务。

豆包工作任务加入技能、连接器和专业 Agent

豆包在电脑版「工作任务」模式中上线技能、连接器和「工作伙伴/小队」。用户可在侧边栏选择对应入口,把常用工作步骤、交付标准和参考模板整理成可重复调用的自定义技能。

豆包称,当前已上架超过 200 个技能和连接器。连接器用于在常用工具中查找信息并处理任务;「工作伙伴」则让用户按专业方向选择不同 Agent,由它们协同分析问题、拆解步骤和完成交付。

这次更新把工作任务从单次问答扩展为可复用流程和多 Agent 协作,但具体连接器清单与各项能力的开放范围以豆包电脑版实际账户为准。

商汤开源 SenseNova U1.5 正式版,原生支持 4K 图像生成

商汤 8 月 20 日开源 SenseNova U1.5-8B-MoT 正式版。相较 7 月底发布的预览版,新权重继续改进复杂指令遵循、中英文文字渲染、海报和信息图布局、主体一致性及局部编辑,并原生支持 4K 图像生成。

模型采用统一的多模态架构,可执行图像生成、编辑、视觉理解和图文交错生成。官方同时发布 8 步推理 LoRA,以降低生成延迟,并计划继续开放从监督微调、强化学习到 MOPD 的完整训练流程。

项目也列出了当前边界:密集长文本仍可能出现错误,高约束布局中的数量和对齐不够稳定,小尺寸人脸、手部和肢体细节仍会失真,多轮复杂编辑也可能产生漂移。

DeepSeek Harness 新增 Codex 与 Claude Code 子代理接口

DeepSeek Harness 近期更新子代理子系统,可把 Codex、Claude Code、进程内 Agent、ACP Agent 和 Harness SDK Agent 注册为并列提供方,由主 Agent 按任务选择并启动子代理。

官方文档显示,subagent-codex 会通过 Codex app-server 启动独立子进程,subagent-claude-code 则调用 Claude Agent SDK。Harness 还提供统一的消息、打断、列表与结果回传接口,父 Agent 可继续管理仍在运行的子任务。

这是 DeepSeek Harness 8 月 13 日开放开发者预览后的增量更新,重点从基础工作台扩展到跨 Agent 编排;第三方 DSH-IM 网关还可把同一 Harness 接入飞书、钉钉、微信、QQ 等聊天渠道。

同程旅行完成收购嘀嗒出行,后者保持独立运营

昨天,同程旅行与嘀嗒出行发布联合公告,宣布针对嘀嗒出行股份的自愿有条件全面现金要约已截止,收购正式完成。同程旅行表示,嘀嗒出行将继续保持品牌和运营独立,并计划维持其中国香港上市地位。

收购完成后,双方将继续独立发展各自业务,同时在用户服务、出行场景和技术能力等方面探索协同。嘀嗒出行的业务以顺风车和智慧出租车服务为主,同程旅行则覆盖交通票务、住宿预订及旅游服务。

曝 YouTube 向头部创作者支付独占费用,阻止节目同步给 Netflix

据彭博社报道,YouTube 正与部分头部频道商谈限时独占合作:创作者接受现金激励后,需要先把节目独家上传到 YouTube,独占期结束后才能授权给 Netflix 等平台。

知情人士称,资金安排包括直接为部分节目提供制作资金,或把大型品牌合作的一部分分配给创作者。YouTube 尚未敲定交易,但已接近与数个合作方达成协议。

这轮谈判针对 Netflix 近来引入 YouTube 头部创作者的动作。对不接受独占条件的创作者,YouTube 可能减少大型品牌合作与节目投资机会,但其日常上传权限不受影响。

✨ 是周末啊!

One Fun Thing|1.58 万元,问界把 M9 缩成一辆能远程接管的儿童车

问界儿童车把 M9 的设计语言缩进一副双座敞篷车身:贯穿式灯带、同款轮毂和车规级金属漆都被保留下来,车身长 1500 mm,提供金瑞红、赛里木青和暖云白三种颜色。

孩子可以自行驾驶,家长也能随时用遥控器接管。车辆配备 350 W 电机,标称续航 20 公里,并设置两档限速;防侧翻结构、圆角软包和双座安全带用于降低使用风险。

前后双 1080P 摄像头和鸿蒙智联让家长可以通过 App 查看车辆状态、设置电子围栏并进行双向语音。产品由赛力斯与华为联合设计,已开启预订,计划 8 月 30 日上市,售价 1.58 万元。

周末看什么|《龙之家族》最新一季完结,坦格利安内战进入正面冲突

《龙之家族》最新一季已在 HBO Max 完整上线。故事继续改编乔治·R·R·马丁的《血与火》,雷妮拉与伊耿二世争夺铁王座的内战从政治对峙进入更大规模的海战、龙战与阵营分裂。

本季季终集上线前三天触达 2100 万观众,其中美国观众超过 1100 万;整季目前平均每集 3400 万观众,接近第二季的 3500 万。Rotten Tomatoes 收录 171 篇媒体评价,新鲜度为 91%。

本季由 Emma D’Arcy、Olivia Cooke 和 Matt Smith 继续主演,共 8 集。季终集把此前积累的阵营矛盾集中推向战场,也为后续故事留下了明确的权力断点。

买书不读指南|《验证智能》把生成式 AI 放回教育技术史

南加州大学教育学者 Stephen J. Aguilar 在《Authenticating Intelligence》中回看课堂电视、早期教育软件到生成式 AI 辅导工具的演进,讨论新技术如何进入学校和大学,并改变教学设计、个性化学习与师生分工。

作者用「用户、技术、环境」三者互动作为分析框架,分别处理 K-12、高等教育、教育公平和学术诚信。书中结合设计理论、教育技术研究、课堂案例和操作清单,分析 AI 提升学习效率的条件,以及偏见、作弊和资源差距可能被放大的环节。

本书由 Bloomsbury Academic 于 8 月 6 日出版,共 200 页。Aguilar 现任南加州大学生成式 AI 与社会中心主任。

游戏推荐|Agent 64 把 90 年代主机谍战 FPS 做成合作战役

《Agent 64: Spies Never Die》沿着 90 年代主机射击游戏的手感,搭了一套 1997 年想象中的谍战世界。玩家扮演特工 John Walter,在摩天楼、夜店、博物馆、地下墓穴和雪地基地等场景完成 14 个任务,对抗反派 Dominic Pulp。

每关都是可以反复探索的独立地图,目标包括入侵终端、偷取机密计划和营救人质。三档难度不只是调整敌人强度,还会增加任务目标、开放更多区域;通关挑战还能解锁 70 多种 Paradox 修改器,用大头模式、近战缴械或无需换弹等规则重新混合关卡。

整套战役支持单人、分屏和在线合作,竞技场则允许最多 8 名玩家再加入 8 个机器人。游戏由 Replicant D6 开发,8 月 11 日登陆 Steam,暂不支持中文;Steam 当前 723 篇评价中约 88% 为好评,整体为「特别好评」,国区现售 72.83 元。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/UYkNHC4
via IFTTT

2026年8月20日星期四

ChatGPT 可以看短信了,AI 想从你的 App 里拿到你的一切

ChatGPT 现在可以直接「翻」你的 iMessage 了。

今天凌晨,OpenAI 正式为 Mac 端的 ChatGPT 上线 Apple Messages 连接器。授予相应系统权限后,输入「@」并选择「Messages」,ChatGPT 就能检索、分析聊天记录,并帮你起草回复。

把散碎的聊天记录,变成可执行的结构化数据

比如对 ChatGPT 说一句「整理昨天有哪些我需要跟进的事情」,它会翻看昨天的聊天记录,从里面找出那些没有下文的事情。

OpenAI 展示的例子里,读书俱乐部的一位朋友问「我们下次聚会是什么时候」。ChatGPT 找到这条消息之后,又去日历里确认了活动时间,最后顺手拟好回复。

另一个例子则是很常见的约饭。朋友在 Messages 里约你下周吃饭,你可以让 ChatGPT 看一下自己的日历,再告诉对方哪几个时间有空。

不过,ChatGPT 并不会「自作主张」直接帮你回复,在卡片中直接修改文字,确认无误后点击发送,消息才会正式出现在 iMessage 的对话流里。

类似的事情在聊天记录里其实随处可见。朋友随口提到的生日、同事说下周继续处理的工作、家人约好的聚餐……这些琐事,现在都可以被模型主动调用,变成理解用户近况和继续完成任务的「上下文」。

这也是 OpenAI 最近一系列产品变化里越发明显的趋势。

图|ChatGPT Finances

今年 5 月推出的 ChatGPT Finances,允许用户通过 Plaid 连接银行账户、信用卡和投资账户。接入之后,用户可以直接问 ChatGPT 自己最近的钱花到了哪里、有哪些固定订阅、资产和负债发生了什么变化。

图|ChatGPT Health

此前的 ChatGPT Health 思路也类似。连接 Apple Health 和医疗记录之后,ChatGPT 可以在用户授权范围内参考睡眠、运动、活动和其他健康信息。

到了 Messages,模型又开始接触用户的聊天记录,以及聊天背后错综复杂的日常安排和人际关系。

这几项功能放在一起,OpenAI 的思路其实很清楚:通过用户已经在使用的应用和服务,间接获得更多关于这个人的信息。

图|TechRadar

这和传统的 ChatGPT「记忆」还不太一样。记忆主要来自用户过去主动告诉 ChatGPT 的内容;这些连接器接入的,则是其他应用长期记录下来的真实数据。

过去想让 ChatGPT 分析一段聊天,需要截图或者复制聊天记录;想聊最近的消费,自己去把账单找出来;问最近为什么总是很累,也得先交代自己的睡眠和运动情况。

接入这些应用以后,模型不再需要你「动嘴」,ChatGPT 能了解到的「你」,也由此开始从对话框里的几句话,慢慢扩展到日常生活留下的各种记录。

沙盒还在,但 OpenAI 选了条「邪修」路径

问题也随之而来:苹果不是一直把不同 App 和数据隔离得很严吗?

确实。出于安全与隐私考量,苹果在过去十多年里用沙盒机制(Sandbox)与权限清单(Entitlements)构筑了严密的护城河。

一个得到 Health 权限的运动 App,不会因此获得 Messages 的聊天记录;同样,保存几年聊天内容的「信息」App,也没有理由跑去查看你的健康数据。

有意思的是,面对这套坚固的沙盒,OpenAI 讨巧地选择了一条颇具极客色彩的「邪修」路径。

它利用 macOS 长期存在的高级权限与自动化机制,绕开了传统 App 的边界约束:通过索取「完全磁盘访问权限」(Full Disk Access)直接读取本地的 SQLite 聊天数据库,再借助 AppleScript、Apple Events 与辅助功能(Accessibility)等原生 API 来解析与起草消息。

沙盒与底层安全机制并没有失效,但 OpenAI 巧妙地借用系统留给高阶自动化工具的权限缝隙,打破了长久以来心照不宣的产品边界。

苹果负责守门,谁来负责编排?

把系统服务串联起来这件事,苹果自己其实已经做了很多年。

在「快捷指令」时代,串联规则高度依赖人类手动搭建一条严苛而死板的流水线:「读取日历空闲 → 筛选可用时段 → 匹配联系人 → 格式化文本 → 唤起信息发送」。

图|AppleInsider

每一步该读取什么、得到结果之后再做什么,基本都由人提前规定。快捷指令负责按照这套规则执行。

AI Agent 则直接颠覆了这套逻辑。用户只需要随口说一句:「看我下周什么时候有空,回小王约顿饭。」模型便能自己拆解任务:

先去「信息」App 理解邀约语境,从「通讯录」App 判断「小王」是谁,再进入「日历」App 寻找空闲档期,最后把拟好的回复送回「信息」App 等待确认。

数据隔间依旧存在,权限也没有消失,但在这些沙盒之上,大模型开始搭起一层新的「语义总线」。

这些原本割裂在系统各个角落的数据,正在被拼成一幅越来越完整、鲜活的个体画像。于是,一个新的问题也浮了出来:在未来的操作系统里,究竟谁来负责这层编排?

苹果依然牢牢握着最底层的钥匙。什么 App 能访问什么数据、哪些动作需要确认、哪些权限绝不能越界,最终都由系统说了算。

但当用户完成授权之后,去理解一句自然语言、判断该调用哪些服务,并把它们组织成一条完整任务链的能力,正在成为 AI 时代新的入口。

图|The Verge

OpenAI 今天在 Mac 上做的这些尝试,反而让我们对苹果自己的 Siri AI 更加期待。

毕竟,没有谁比第一方的 Siri 更靠近这些系统服务。苹果花了十几年,把数据和应用放进一个个权限分明的「房间」;如果 Siri AI 能够顺畅读懂意图,并在授权范围内自如调度这些房间,它才最有资格成为系统原生的「总指挥」。

否则,守门的虽然还是苹果,但发号施令的指挥权,可能就落在别人家的 AI 手里了。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/HU96eRp
via IFTTT