2026年8月21日星期五

早报|摄像头AirPods或配备拍摄指示灯/问界儿童车售价1.58万元/LV否认「起诉国家知识产权局遭驳回」

🎨

GPT Image 2 API 开始预览透明背景生成

🤖

DeepSeek 上线 V4-Flash-Vision-Exp 多模态视觉理解模型

⚠

9 家车企因应急机械拉手隐患召回约 427.6 万辆汽车

☁

阿里二季度重组电商与 AI 业务架构

💻

腾讯芯片负责人高剑林被曝离职创业,瞄准 RISC-V AI CPU

📋

旺旺被曝启动裁员,并要求员工提交自评报告

🛍

LV 否认「起诉国家知识产权局遭驳回」

💰

泡泡玛特拟在半年内回购股份

🚀

奇瑞旗下 AiMOGA 筹备 IPO,明年目标交付 1 万台机器人

💻

AMD x86 客户端 CPU 出货份额首次突破 30%

💡

李彦宏:文心大模型要重回基础模型第一梯队

🦿

雷鸟 iO 发布:34g、双目显示,首发 1996 元起

🤖

小红书开源 dots3-note preview,支持 512K 多模态上下文

💳

百度秒哒接入支付宝支付 Skill

💻

豆包工作任务加入技能、连接器和专业 Agent

🔧

商汤开源 SenseNova U1.5 正式版,原生支持 4K 图像生成

🤖

DeepSeek Harness 新增 Codex 与 Claude Code 子代理接口

🚙

同程旅行完成收购嘀嗒出行,后者保持独立运营

🌐

曝 YouTube 向头部创作者支付独占费用,阻止节目同步给 Netflix

📰 周末也值得一看的新闻

带摄像头 AirPods 更多参数曝光,或配备拍摄指示灯

据 MacRumors 报道,苹果带摄像头的 AirPods 曝光更多参数,左右耳机或各配备一枚摄像头,可采集同步彩色静态图像,供 Visual Intelligence 分析,但目前不支持视频录制。

代码显示,该产品在主动模式下可采集 640 × 640 图像,并输出 1024 × 1024 处理结果;被动模式下则采集 320 × 320 图像,输出分辨率为 320 × 320 或 512 × 512。被动模式可能用于感知附近语音、环境音变化、头部转动和周围移动等情况。

相关框架还包含镜头畸变校正、双摄像头校准,以及摄像头与运动传感器校准功能,并支持在设备端判断画面中是否有人。代码同时提到硬件指示灯及亮度控制,暗示 AirPods 可能配备拍摄指示灯,用于提示周围人员设备正在采集图像。

目前曝光信息尚不能确认最终产品规格。此前曝光的 B790 版本据称已取消,苹果转而开发代号为 B798 的新一代摄像头 AirPods,预计明年推出。

GPT Image 2 API 开始预览透明背景生成

OpenAI 8 月 21 日宣布,GPT Image 2 API 开始预览透明背景生成功能。开发者可直接生成能叠加到不同背景上的可复用素材,用于产品图片、平面设计、网站原型和营销内容。

这项更新补上了 GPT Image 2 此前在 API 中不支持透明背景的能力缺口。官方模型页面显示,GPT Image 2 可通过图像生成与图像编辑端点使用,并支持灵活的图像尺寸和高保真图像输入。

同日,LMArena 上出现名为 luna-lisa-alpha 的匿名图像模型,部分测试者猜测它可能与 OpenAI 的下一代图像模型有关;OpenAI 尚未确认该模型身份,因此现阶段不能将其视为 GPT Image 2.5 的正式预告。

DeepSeek 上线 V4-Flash-Vision-Exp 多模态视觉理解模型

昨天,DeepSeek 上线实验性视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并将其开放至 API 平台。用户可通过 deepseek-v4-flash-vision-exp 模型名调用;官方称,其纯文本 Agent、推理与知识能力与 V4-Flash 正式版基本持平,同时补上图像理解能力。

官方公布的 4 项多模态 Agent 评测中,该模型在 Agents’ Last Exam 和 ZeroBench 上高于 Opus 4.8,在 ApexBench 与 Chartography 上略低。上述成绩均来自厂商测试,测试所用的 Agent 框架和任务设置也由官方给出。

API 支持 Chat Completions、Messages 和 Responses 三种调用格式,可接收 base64、外部 URL 与 Files API 三种图像输入。一张图片最多转换为 384 个 token,计费价格与 V4-Flash 相同。同步开放的 Files API 不收取存储费用,同一图片上传后可通过 file_id 跨请求复用。

9 家车企因应急机械拉手隐患召回约 427.6 万辆汽车

昨天,特斯拉、小米、小鹏、吉利、零跑、奇瑞、东风、北汽蓝谷和一汽向国家市场监督管理总局备案召回计划,涉及约 427.6 万辆汽车。主要问题是车内应急机械拉手与内饰颜色接近、不易识别和操作,严重碰撞导致低压系统失效时,可能影响乘员逃生和车外救援。

特斯拉涉及约 297.6 万辆国产及进口 Model 3、Model Y、Model X 和 Model S,是本轮规模最大的一家;小米涉及约 39 万辆 SU7,零跑涉及约 37.1 万辆 C01 和 C11,小鹏涉及约 26.5 万辆 G6、P7+ 和 X9。其余召回车型包括极氪 007、极氪 X、iCAR 03、风云 X3、纳米 06、风神 L8、eπ007、eπ008、极狐考拉、红旗 EH7 和天工 08。

各车企将按车型加贴或更换提示标识,部分车型还会通过 OTA 优化事故后降窗、中控解锁等策略。小鹏、一汽部分车型仅加贴标识,奇瑞则会同时更换改进后的应急机械拉手盖板。

隐藏式电子门把手由特斯拉带动普及,车辆断电后如果应急机械释放装置位置不清晰,可能增加逃生和救援难度。中国已决定从 2027 年起禁止隐藏式车门外把手;美国监管机构正在研究适用于所有车企的新安全标准,联合国欧洲经济委员会也在起草断电后仍能从车内外开启车门的相关标准。

阿里二季度重组电商与 AI 业务架构

阿里巴巴公布截至 6 月 30 日的季度业绩,收入为 2689.53 亿元,净利润为 104.44 亿元。公司把利润下滑主要归因于经营利润减少、处置投资收益和股权投资公允价值变动收益下降。

本季度阿里同步调整业务架构:国内与国际电商、盒马及菜鸟部分商业业务并入阿里电商集团;云智能集团与平头哥合并为「AI 云与计算服务」;模型实验室、千问消费者业务、QwenWork 则组成「AI 实验室与应用」。

AI 云与计算服务季度收入为 484.37 亿元,AI 相关产品收入连续第 12 个季度实现三位数增长。阿里本季度资本开支增至 676.78 亿元,主要用于扩充 AI 基础设施。

腾讯芯片负责人高剑林被曝离职创业,瞄准 RISC-V AI CPU

据「半导体行业观察」报道,腾讯芯片研发负责人高剑林近期离职,计划围绕高性能 AI 服务器和 Agentic AI 创业,研发基于 RISC-V 架构的高性能 CPU。报道援引知情人士称,他在腾讯负责的方向覆盖 AI 加速、CPU、RISC-V 架构、芯片验证和后端团队。

高剑林 2013 年在腾讯发起组建硬件团队,随后推动 FPGA 云服务器、AI 芯片和 RISC-V 核心研发。2020 年腾讯成立蓬莱实验室后,其团队完成腾讯首颗 TPU 架构 AI 芯片回片,并在数据中心部署后续芯片。

这次创业目前仍属于媒体独家消息,腾讯与高剑林尚未公开披露新公司的名称、融资或产品发布时间。

旺旺被曝启动裁员,并要求员工提交自评报告

据财新报道,中国旺旺近期启动裁员。多名接近公司的人士称,一名离职员工听说集团计划裁员约 1000 人、目前已裁约 400 人;另一名离职员工称,其所在部门计划优化 8% 的员工。中国旺旺在报道刊发前未回复问询。

多名员工还称,公司要求总部全体人员围绕过去一年的实际结果提交自评报告,由直属和隔级主管逐项评分,但单位最高主管无需参加。自评要求员工以事实和数据剖析不足。

这项调整延续了董事长蔡衍明本月初内部信释放的信号。蔡衍明此前称公司遭遇「重大经营危机」,要求淘汰没有贡献的干部,并调整长期未变的经销商合作方式。

LV 否认「起诉国家知识产权局遭驳回」

第一财经 8 月 21 日报道,针对「LV 起诉国家知识产权局遭法院驳回」的消息,LV 内部知情人士回应称,相关说法不实,案件仍处于法定程序中,尚未形成最终结论。

这起商标行政纠纷围绕一枚四瓣花图形商标展开。LV 此前主张广东汕头个体户黄民耀注册的图形与其商标近似,并向国家知识产权局申请宣告无效;国家知识产权局审查后认为两者细节差异较大、普通消费者不易混淆,维持了该商标注册,LV 随后提起行政诉讼。

LV 表示,该案属于围绕具体商标行政决定展开的正常法律程序,公司不对仍在进行的案件作进一步评论。

泡泡玛特拟在半年内回购股份

泡泡玛特发布上半年业绩后,创始人兼董事长王宁在业绩会上表示,公司计划在未来 6 个月内回购不低于 20 亿元、不高于 50 亿元的股份。他同时称,今年大概率无法完成年初提出的营收增长目标,下半年经营压力高于上半年。

公司上半年收入为 171.7 亿元,经调整净利润为 51.6 亿元。王宁将今年定位为经营调整年,表示提升销售额不是当前首要目标。

泡泡玛特称,THE MONSTERS、TWINKLE TWINKLE、CRYBABY 等多个 IP 均形成规模化收入,IP 组合较此前更分散。

奇瑞旗下 AiMOGA 筹备 IPO,明年目标交付 1 万台机器人

据路透社报道,奇瑞汽车旗下机器人公司 AiMOGA 正与多个潜在上市地沟通,希望通过 IPO 为后续技术投资筹集资金。AiMOGA 随后表示,公司尚未就 IPO 采取任何实质行动;奇瑞目前持有其近 77% 股权。

AiMOGA 负责人、奇瑞国际总裁张贵兵表示,公司自 2025 年 1 月孵化以来,已在全球交付超过 3000 台机器人,其中 2000 台交付至海外,覆盖 60 多个国家和地区;明年的全球交付目标为 1 万台。

公司早期把双足人形机器人投入奇瑞展厅,目前正扩展至交通管理、人群引导和公共安全宣传等场景,已有 110 台警务机器人在中国多个城市部署。张贵兵称,中东和东南亚的高温、强降雨环境可能带来更强的公共服务机器人需求。

AMD x86 客户端 CPU 出货份额首次突破 30%

Mercury Research 最新数据表明,今年第二季度,AMD 在 x86 客户端 CPU 市场的出货份额升至 30.3%,首次跨过 30% 门槛;英特尔份额为 69.7%。AMD 上一季度份额为 29.6%,去年同期为 23.9%,一年提高了 6.4 个百分点。

这项统计覆盖台式机和笔记本电脑处理器的供应链出货量,不代表终端设备保有量,也不包含 Apple Silicon、高通 Snapdragon 等 Arm 处理器。AMD 的本季度增量同时来自台式机与移动处理器。

Mercury Research 称,第二季度 x86 与 Arm CPU 总出货量环比增长超过 10%,明显高于通常的季节性表现;另一家研究机构 Jon Peddie Research 认为,部分增长来自电脑厂商在英特尔第一季度供应受限后重建库存。

💡 李彦宏:文心大模型要重回基础模型第一梯队

百度董事长兼 CEO 李彦宏在二季度业绩电话会上表示,文心大模型要重新回到基础大模型第一梯队。他承认百度在探索过程中出现过试错,但称公司不会改变让文心具备核心竞争力的承诺。

李彦宏把长期竞争力归结为持续稳定的技术投入、以应用落地为导向的产品策略和耐心。他表示,百度不会同时铺开所有场景,而会集中资源推进 AI 搜索、数字人和秒哒等生态内重点方向,并加快文心迭代。

百度官方材料显示,二季度 AI 驱动业务收入已占一般性业务收入的一半,AI 云基础设施与文库、网盘的 AI 用户渗透率继续增长。

李彦宏作出这一判断的背景,是基础模型竞争格局仍在快速变化,百度此前未能持续保持领先。他提出的推进方案包括引进人工智能人才、维持研发投入,并把有限资源集中到百度已有产品和分发能力能够承接的场景,而不是同时扩张所有应用方向。

雷鸟 iO 发布:34g、双目显示,首发 1996 元起

雷鸟创新 8 月 21 日发布 AI 眼镜雷鸟 iO,正式售价 2499 元,首发到手价 1996 元起,即日起在京东、天猫、抖音及线下眼镜渠道开售,并提供 0 至 1000 度近视配镜方案。

雷鸟 iO 采用双目显示架构,等效 33 英寸画面,入眼亮度为 1800 尼特;整机最低重量 34g,支持两天日常续航和 18 小时连续记录。交互上配有 Smart Crown 旋钮,并支持点头确认、摇头取消。

这款眼镜不配备摄像头,主要通过 4 颗阵列麦克风和 1 颗骨传导麦克风处理会议记录、实时翻译和提词。录音、翻译等功能启用时,镜腿隐私状态灯会同步亮起且不能通过软件关闭;翻译覆盖 55 种语言和 109 种口音。

小红书开源 dots3-note preview,支持 512K 多模态上下文

小红书 dots studio 开源 dots3-note preview,并在 dots.ai 开放平台提供 API 限时免费调用。它是 dots3 系列首个开放权重模型,采用混合专家架构,总参数量为 2800 亿,推理时激活 160 亿参数,最长支持 512K token 上下文。

模型可同时接收文本、图像、视频和音频,输出文本,主要面向知识问答、数学与逻辑推理、代码生成、工具调用、多步 Agent 工作流和长上下文处理。官方提供 BF16 与 FP8 权重,并给出 SGLang、vLLM 两种部署路径。

官方建议 FP8 版本部署在单台 8 卡 GPU 服务器上;vLLM 的原生支持目前位于主分支,稳定版尚未包含这一适配。

百度秒哒接入支付宝支付 Skill

昨天,支付宝宣布,百度旗下无代码应用生成平台秒哒已接入支付宝支付 Skill。开发者在秒哒创建或修改网页应用时,可直接要求 Agent 加入支付宝收款能力,不必自行编写支付接口代码。

该 Skill 默认提供不涉及真实资金的沙箱环境,完成测试后,开发者仍需在支付宝 AI 付站点申请开通网页应用收款、配置应用密钥,才能切换至线上环境。接入范围包括电商店铺、付费课程、活动报名和咨询服务等网页应用。

支付宝表示,TRAE SOLO、扣子编程、Qoder 和百度秒哒目前均已接入这一能力。对个人开发者而言,付款结果可自动回传到应用,用于即时开通额度或交付数字服务。

豆包工作任务加入技能、连接器和专业 Agent

豆包在电脑版「工作任务」模式中上线技能、连接器和「工作伙伴/小队」。用户可在侧边栏选择对应入口,把常用工作步骤、交付标准和参考模板整理成可重复调用的自定义技能。

豆包称,当前已上架超过 200 个技能和连接器。连接器用于在常用工具中查找信息并处理任务;「工作伙伴」则让用户按专业方向选择不同 Agent,由它们协同分析问题、拆解步骤和完成交付。

这次更新把工作任务从单次问答扩展为可复用流程和多 Agent 协作,但具体连接器清单与各项能力的开放范围以豆包电脑版实际账户为准。

商汤开源 SenseNova U1.5 正式版,原生支持 4K 图像生成

商汤 8 月 20 日开源 SenseNova U1.5-8B-MoT 正式版。相较 7 月底发布的预览版,新权重继续改进复杂指令遵循、中英文文字渲染、海报和信息图布局、主体一致性及局部编辑,并原生支持 4K 图像生成。

模型采用统一的多模态架构,可执行图像生成、编辑、视觉理解和图文交错生成。官方同时发布 8 步推理 LoRA,以降低生成延迟,并计划继续开放从监督微调、强化学习到 MOPD 的完整训练流程。

项目也列出了当前边界:密集长文本仍可能出现错误,高约束布局中的数量和对齐不够稳定,小尺寸人脸、手部和肢体细节仍会失真,多轮复杂编辑也可能产生漂移。

DeepSeek Harness 新增 Codex 与 Claude Code 子代理接口

DeepSeek Harness 近期更新子代理子系统,可把 Codex、Claude Code、进程内 Agent、ACP Agent 和 Harness SDK Agent 注册为并列提供方,由主 Agent 按任务选择并启动子代理。

官方文档显示,subagent-codex 会通过 Codex app-server 启动独立子进程,subagent-claude-code 则调用 Claude Agent SDK。Harness 还提供统一的消息、打断、列表与结果回传接口,父 Agent 可继续管理仍在运行的子任务。

这是 DeepSeek Harness 8 月 13 日开放开发者预览后的增量更新,重点从基础工作台扩展到跨 Agent 编排;第三方 DSH-IM 网关还可把同一 Harness 接入飞书、钉钉、微信、QQ 等聊天渠道。

同程旅行完成收购嘀嗒出行,后者保持独立运营

昨天,同程旅行与嘀嗒出行发布联合公告,宣布针对嘀嗒出行股份的自愿有条件全面现金要约已截止,收购正式完成。同程旅行表示,嘀嗒出行将继续保持品牌和运营独立,并计划维持其中国香港上市地位。

收购完成后,双方将继续独立发展各自业务,同时在用户服务、出行场景和技术能力等方面探索协同。嘀嗒出行的业务以顺风车和智慧出租车服务为主,同程旅行则覆盖交通票务、住宿预订及旅游服务。

曝 YouTube 向头部创作者支付独占费用,阻止节目同步给 Netflix

据彭博社报道,YouTube 正与部分头部频道商谈限时独占合作:创作者接受现金激励后,需要先把节目独家上传到 YouTube,独占期结束后才能授权给 Netflix 等平台。

知情人士称,资金安排包括直接为部分节目提供制作资金,或把大型品牌合作的一部分分配给创作者。YouTube 尚未敲定交易,但已接近与数个合作方达成协议。

这轮谈判针对 Netflix 近来引入 YouTube 头部创作者的动作。对不接受独占条件的创作者,YouTube 可能减少大型品牌合作与节目投资机会,但其日常上传权限不受影响。

✨ 是周末啊!

One Fun Thing|1.58 万元,问界把 M9 缩成一辆能远程接管的儿童车

问界儿童车把 M9 的设计语言缩进一副双座敞篷车身:贯穿式灯带、同款轮毂和车规级金属漆都被保留下来,车身长 1500 mm,提供金瑞红、赛里木青和暖云白三种颜色。

孩子可以自行驾驶,家长也能随时用遥控器接管。车辆配备 350 W 电机,标称续航 20 公里,并设置两档限速;防侧翻结构、圆角软包和双座安全带用于降低使用风险。

前后双 1080P 摄像头和鸿蒙智联让家长可以通过 App 查看车辆状态、设置电子围栏并进行双向语音。产品由赛力斯与华为联合设计,已开启预订,计划 8 月 30 日上市,售价 1.58 万元。

周末看什么|《龙之家族》最新一季完结,坦格利安内战进入正面冲突

《龙之家族》最新一季已在 HBO Max 完整上线。故事继续改编乔治·R·R·马丁的《血与火》,雷妮拉与伊耿二世争夺铁王座的内战从政治对峙进入更大规模的海战、龙战与阵营分裂。

本季季终集上线前三天触达 2100 万观众,其中美国观众超过 1100 万;整季目前平均每集 3400 万观众,接近第二季的 3500 万。Rotten Tomatoes 收录 171 篇媒体评价,新鲜度为 91%。

本季由 Emma D’Arcy、Olivia Cooke 和 Matt Smith 继续主演,共 8 集。季终集把此前积累的阵营矛盾集中推向战场,也为后续故事留下了明确的权力断点。

买书不读指南|《验证智能》把生成式 AI 放回教育技术史

南加州大学教育学者 Stephen J. Aguilar 在《Authenticating Intelligence》中回看课堂电视、早期教育软件到生成式 AI 辅导工具的演进,讨论新技术如何进入学校和大学,并改变教学设计、个性化学习与师生分工。

作者用「用户、技术、环境」三者互动作为分析框架,分别处理 K-12、高等教育、教育公平和学术诚信。书中结合设计理论、教育技术研究、课堂案例和操作清单,分析 AI 提升学习效率的条件,以及偏见、作弊和资源差距可能被放大的环节。

本书由 Bloomsbury Academic 于 8 月 6 日出版,共 200 页。Aguilar 现任南加州大学生成式 AI 与社会中心主任。

游戏推荐|Agent 64 把 90 年代主机谍战 FPS 做成合作战役

《Agent 64: Spies Never Die》沿着 90 年代主机射击游戏的手感,搭了一套 1997 年想象中的谍战世界。玩家扮演特工 John Walter,在摩天楼、夜店、博物馆、地下墓穴和雪地基地等场景完成 14 个任务,对抗反派 Dominic Pulp。

每关都是可以反复探索的独立地图,目标包括入侵终端、偷取机密计划和营救人质。三档难度不只是调整敌人强度,还会增加任务目标、开放更多区域;通关挑战还能解锁 70 多种 Paradox 修改器,用大头模式、近战缴械或无需换弹等规则重新混合关卡。

整套战役支持单人、分屏和在线合作,竞技场则允许最多 8 名玩家再加入 8 个机器人。游戏由 Replicant D6 开发,8 月 11 日登陆 Steam,暂不支持中文;Steam 当前 723 篇评价中约 88% 为好评,整体为「特别好评」,国区现售 72.83 元。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/UYkNHC4
via IFTTT

2026年8月20日星期四

ChatGPT 可以看短信了,AI 想从你的 App 里拿到你的一切

ChatGPT 现在可以直接「翻」你的 iMessage 了。

今天凌晨,OpenAI 正式为 Mac 端的 ChatGPT 上线 Apple Messages 连接器。授予相应系统权限后,输入「@」并选择「Messages」,ChatGPT 就能检索、分析聊天记录,并帮你起草回复。

把散碎的聊天记录,变成可执行的结构化数据

比如对 ChatGPT 说一句「整理昨天有哪些我需要跟进的事情」,它会翻看昨天的聊天记录,从里面找出那些没有下文的事情。

OpenAI 展示的例子里,读书俱乐部的一位朋友问「我们下次聚会是什么时候」。ChatGPT 找到这条消息之后,又去日历里确认了活动时间,最后顺手拟好回复。

另一个例子则是很常见的约饭。朋友在 Messages 里约你下周吃饭,你可以让 ChatGPT 看一下自己的日历,再告诉对方哪几个时间有空。

不过,ChatGPT 并不会「自作主张」直接帮你回复,在卡片中直接修改文字,确认无误后点击发送,消息才会正式出现在 iMessage 的对话流里。

类似的事情在聊天记录里其实随处可见。朋友随口提到的生日、同事说下周继续处理的工作、家人约好的聚餐……这些琐事,现在都可以被模型主动调用,变成理解用户近况和继续完成任务的「上下文」。

这也是 OpenAI 最近一系列产品变化里越发明显的趋势。

图|ChatGPT Finances

今年 5 月推出的 ChatGPT Finances,允许用户通过 Plaid 连接银行账户、信用卡和投资账户。接入之后,用户可以直接问 ChatGPT 自己最近的钱花到了哪里、有哪些固定订阅、资产和负债发生了什么变化。

图|ChatGPT Health

此前的 ChatGPT Health 思路也类似。连接 Apple Health 和医疗记录之后,ChatGPT 可以在用户授权范围内参考睡眠、运动、活动和其他健康信息。

到了 Messages,模型又开始接触用户的聊天记录,以及聊天背后错综复杂的日常安排和人际关系。

这几项功能放在一起,OpenAI 的思路其实很清楚:通过用户已经在使用的应用和服务,间接获得更多关于这个人的信息。

图|TechRadar

这和传统的 ChatGPT「记忆」还不太一样。记忆主要来自用户过去主动告诉 ChatGPT 的内容;这些连接器接入的,则是其他应用长期记录下来的真实数据。

过去想让 ChatGPT 分析一段聊天,需要截图或者复制聊天记录;想聊最近的消费,自己去把账单找出来;问最近为什么总是很累,也得先交代自己的睡眠和运动情况。

接入这些应用以后,模型不再需要你「动嘴」,ChatGPT 能了解到的「你」,也由此开始从对话框里的几句话,慢慢扩展到日常生活留下的各种记录。

沙盒还在,但 OpenAI 选了条「邪修」路径

问题也随之而来:苹果不是一直把不同 App 和数据隔离得很严吗?

确实。出于安全与隐私考量,苹果在过去十多年里用沙盒机制(Sandbox)与权限清单(Entitlements)构筑了严密的护城河。

一个得到 Health 权限的运动 App,不会因此获得 Messages 的聊天记录;同样,保存几年聊天内容的「信息」App,也没有理由跑去查看你的健康数据。

有意思的是,面对这套坚固的沙盒,OpenAI 讨巧地选择了一条颇具极客色彩的「邪修」路径。

它利用 macOS 长期存在的高级权限与自动化机制,绕开了传统 App 的边界约束:通过索取「完全磁盘访问权限」(Full Disk Access)直接读取本地的 SQLite 聊天数据库,再借助 AppleScript、Apple Events 与辅助功能(Accessibility)等原生 API 来解析与起草消息。

沙盒与底层安全机制并没有失效,但 OpenAI 巧妙地借用系统留给高阶自动化工具的权限缝隙,打破了长久以来心照不宣的产品边界。

苹果负责守门,谁来负责编排?

把系统服务串联起来这件事,苹果自己其实已经做了很多年。

在「快捷指令」时代,串联规则高度依赖人类手动搭建一条严苛而死板的流水线:「读取日历空闲 → 筛选可用时段 → 匹配联系人 → 格式化文本 → 唤起信息发送」。

图|AppleInsider

每一步该读取什么、得到结果之后再做什么,基本都由人提前规定。快捷指令负责按照这套规则执行。

AI Agent 则直接颠覆了这套逻辑。用户只需要随口说一句:「看我下周什么时候有空,回小王约顿饭。」模型便能自己拆解任务:

先去「信息」App 理解邀约语境,从「通讯录」App 判断「小王」是谁,再进入「日历」App 寻找空闲档期,最后把拟好的回复送回「信息」App 等待确认。

数据隔间依旧存在,权限也没有消失,但在这些沙盒之上,大模型开始搭起一层新的「语义总线」。

这些原本割裂在系统各个角落的数据,正在被拼成一幅越来越完整、鲜活的个体画像。于是,一个新的问题也浮了出来:在未来的操作系统里,究竟谁来负责这层编排?

苹果依然牢牢握着最底层的钥匙。什么 App 能访问什么数据、哪些动作需要确认、哪些权限绝不能越界,最终都由系统说了算。

但当用户完成授权之后,去理解一句自然语言、判断该调用哪些服务,并把它们组织成一条完整任务链的能力,正在成为 AI 时代新的入口。

图|The Verge

OpenAI 今天在 Mac 上做的这些尝试,反而让我们对苹果自己的 Siri AI 更加期待。

毕竟,没有谁比第一方的 Siri 更靠近这些系统服务。苹果花了十几年,把数据和应用放进一个个权限分明的「房间」;如果 Siri AI 能够顺畅读懂意图,并在授权范围内自如调度这些房间,它才最有资格成为系统原生的「总指挥」。

否则,守门的虽然还是苹果,但发号施令的指挥权,可能就落在别人家的 AI 手里了。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/HU96eRp
via IFTTT

零基础速通DeepSeek Harness,带你玩转赛博乐高

学不过来,刚刚学会怎么用好 Codex,现在又来了个 DeepSeek Harness。

过去几天,我们已经介绍过它的插件、各种新玩法和新上线的多模态,但还有一个最基础的问题没有解决:DeepSeek Harness 到底该怎么装,又该怎么用?

这次我们从安装、第一次对话、装 Skill、玩插件一路到卸载,带大家从零跑通 DeepSeek Harness。

用 WorkBuddy 安装 DeepSeek Harness

DSH 在某种程度上有点像龙虾,没有完整的点击即安装的应用程序,只有放在代码库里需要通过命令行安装的软件包。

DeepSeek 官方提供了两种方式,一种是从源码安装,获取完整项目源码,并按照仓库说明完成安装。

git clone https://ift.tt/1IlRx4D

对于熟悉 Git 和命令行的用户来说,这套流程并不复杂,但后面还要继续执行 pnpm install、构建项目等一系列操作。如果只是想先体验一下 DeepSeek Harness 的普通用户来说,多少还是有些劝退。

所以更简单的方法,是直接通过 Node.js 快速启动。安装 Node.js 后,只需要输入:

npx @deepseek-ai/dsh web

我们这一批从「龙虾时代」走过来的 AI 原生玩家,电脑上一般都已经安装了 Node.js。在命令行输入 node -v、npm -v 检查一下是否安装好,如果都没有,直接从官网 https://ift.tt/IVq8jMR 下载安装即可。

正常来说,输入快速体验的命令后,我们在浏览器中打开 http://127.0.0.1:3080 该本地地址,就能启动顺利启动 DeepSeek Harness。

如果还是启动失败,不妨试试社区开发的第三方应用。不少开发者已经基于开源的 DeepSeek Harness 仓库,独立开发了相关的应用,可以像安装微信一样,一键安装到本地电脑上。

其中收藏比较多的是由 Anywhere Lab 开发的桌面端,目前在 GitHub 上已经有 14000 个 Star,算是目前关注度最高的第三方客户端之一。

正常安装完成后,其界面和官方的 WebUI 基本是保持一致,不同的地方在于它新增了一个插件市场的入口,我们可以直接在插件市场里找到有意思的插件并安装。

更终极的方法,如果你不想用第三方应用,也不想自己捣鼓终端,交给 WorkBuddy 或者 Codex。

早在我们内测时,安装方法就需要从自己的 GitHub 仓库里面部署,对小白来说是完全不懂。我们就直接把项目链接发给 Codex,Codex 会自动读取项目文档,帮我们在命令行处理那些操作。

同样的 DeepSeek Harness,我们也可以直接把 GitHub 的仓库链接丢给 Codex,https://github.com/deepseek-ai/deepseek-harness,选择 Codex 访问权限为全部访问,等待它慢慢操作,就能直接帮我们打开安装好的 DeepSeek Harness。

用 WorkBuddy 也可以,就选「日常办公」,工作空间可以任意指定一个本地的文件夹,或者干脆不用指定。模型和思考强度不用太纠结,安装任务本身并不复杂;如果中途涉及较多环境排错,再切高推理等级。

然后直接发送「帮我把这个 https://ift.tt/1IlRx4D 项目部署到本地,让我可以通过 http://127.0.0.1:3080 访问该服务。」

很快,Workbuddy 就帮我们安装好了最新版本的 DeepSeek Harness,后续有更新,还可以继续和它对话,让它帮忙更新。

以前安装一个开源项目,第一步是学会敲命令;现在第一步可以是把 GitHub 链接丢给另一个 Agent。

DeepSeek Harness 自己还没有做到点击即用,但 Codex、WorkBuddy 这类本地电脑 Agent,已经把它最劝退普通用户的命令行门槛直接抹掉了,而后续更多的繁琐操作,都可以甩手交给 DeepSeek Harness 处理。

第一次对话,怎么用多模态

和所有的 Agent 一样,工作区可以让我们指定某个文件夹,在该项目内就能直接开启对话。

举个例子,点击对话框,选择本地电脑上任意一个文件夹,可以是新创建的,也可以是包含了具体项目文件的;选择之后,我们就能给 DeepSeek Harness 下需求。

一般来说,模型可以选择 DeepSeek-V4-Pro,推理等级选择 Max,虽然贵一点,但是也能减少我们和 AI 拉扯的时间。

DeepSeek Harness 也会在理解我们需求之后,将项目分成多个有进度可跟踪的任务,以及使用目标模式来控制任务不偏离原需求。

中途遇到需要我们做决策的部分,或者需要授权的审批,DeepSeek Harness 都会弹出通知让我们选择。

和一般的网页版生成不同,DeepSeek Harness 会持续调用工具来完善最终的交付,就像这个《牛来》的游戏,DeepSeek Harness 生成的网页,还是有一定的可玩性的。

甚至还识别到了「半导体老祖」、「跳过小溪」、「父子相认」这些名场面。

而简单的问答或是安装 Skills 现在都可以交给他,例如我们从网上找了一个 PPT 的 Skill,ppt-master,然后直接在对话框发送「帮我安装一下这个 Skill https://ift.tt/QClF5aP」

安装完成之后,直接说用这个 Skill 帮我做一份语文课 PPT,内容是朱自清的《荷塘月色》。

DeepSeek Harness 会遵照 PPT Master Skill 的要求,自动打开一个新的浏览器标签页,要我确认设计方案。

最后生成的效果,也确实很不错。

和其他 Agent 不一样的地方,则是 DeepSeek Harness 新增的「轨迹」页面,把调用了哪些工具,助手的回复,上下文注入以及 Token 的使用都清晰的呈现出来了。

以及多种不同的运行模式,处理不同的任务。

基本的使用大概就是这样,如果是从一个已有文件的本地文件夹,我们也可以让 DeepSeek Harness 帮我们完成文件的整理。

刚好 DeepSeek Harness 最近的更新加入了多模态的功能,在 0820 的更新日志里写着「新增功能:增强多模态支持度,DeepSeek 模型适配器支持配置启用原生图片请求,/goal、/plan 等命令可接收图文输入,@ 菜单支持引用文件和会话」

但实际的情况是 Harness 多模态了,当前用的这个 DeepSeek 模型还没有。

当 DeepSeek Harness 遇到整理的文件是图片时,它依然会报错,表示 DeepSeek-V4-Pro 不是一个支持多模态的模型,它无法读取图片内容。

这次更新打通的是 Harness 的输入管线和模型适配层,所以 DSH 已经能把图片送给支持视觉的模型;V4-Pro 本身不接图片,因此默认组合下依然看不了图。

根据更新的仓库代码显示,前一版本的 DeepSeek Harness 多模态支持处于较基础阶段。在多轮对话中,如果发送了多张图片或单张图太大,极易因为图片历史堆积(Token 超限、API 格式不支持)导致模型请求直接崩溃(Crash)。

更新之后的多模态,不仅仅是聊天框,/goal(目标模式)和 /plan(计划模式)这些底层命令也正式打通了图文输入,并且能在 @ 菜单里直接拖入/引用图片文件。

但如果模型本身不支持「看图」,即模型在 DeepSeek 官方适配器中被标记为 [“text”],就无法使用 DSH 的多模态能力。代码注释还解释了为什么拒绝:工具结果会进入持久会话历史,如果路由不支持图片,会破坏续聊和分叉。

创作第一个插件

万物皆插件,插件几乎是 DeepSeek Harness 最大的亮点,如果不使用插件,可能会觉得 DSH 也不过如此。

在 DeepSeek Harness 官网,给出的自定义插件案例,就有创作 UI 插件,开发贪吃蛇游戏插件,以及自定义一个代码审查模式。

我们可以直接在对话框输入「给当前界面加入一个鲸鱼的背景。」DSH 的插件能力,就能让我们自定义整个用户界面。

从 DSH 的思考轨迹可以看到,它使用的是 Cordis 内核的能力,即 Cordis 内核只负责插件的加载、卸载和依赖关系,不承载 Agent 的具体能力。

基于 Cordis 内核的服务,模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等所有 Agent 能力均可以由插件提供,再通过 Cordis 服务与事件彼此协作。

前段时间,「滑动变祖器」在社交媒体上被网友们疯狂转载。我们也把这个项目链接丢给 DSH,告诉他当我们选择不同的思考深度时,界面的 UI 要根据 Low、High、Max 做出对应的调整。

▲ 提示词:参考这个仓库 https://github.com/Lichtspektrum/liang-intensity-calibrator,把滑动变化的图片设置为 UI 界面的背景,然后当我们选择不同的思考深度时,界面的 UI 要会根据 推理等级 做出对应的调整,变化为不同的图片背景。

类似皮肤的插件还可以在专门的皮肤市场找到更多的案例,有深海女仆工坊、回到 2005 的广告门户网站、海洋皮肤、滑动变祖,以及便签等 189 个皮肤插件。

▲ 地址:https://kingofsoysauce.github.io/dsh-skin-market/

之前我们也分享了 DSH 好玩的插件,也有网友自发整理了各类插件,不过目前主流的玩法还是集中在可视化的 UI、不同任务类型的 Agent 编排、以及处理记忆、连接不同第三方服务的 MCP 等。

如果看到有意思的插件,安装也很简单,除了在终端输入类似的命令 dsh plugin –profile web add github:csyangwen/dsh-memory-evolve,我们甚至可以直接跟 DeepSeek Harness 对话就行。

▲ 安装的记忆插件,让对话框上方从对话和轨迹,变成了包含技能、待办等多项内容的界面

或许有意思的插件,还得自己去对话框一轮一轮测试,记得切换到创造模式,效果或许会更好。

一键卸载

卸载和安装一样,直接告诉 WorkBuddy/Codex 也可以,一句话「帮我卸载电脑上的 DeepSeek Harness。」

如果是通过:npx @deepseek-ai/dsh web 快速体验,DeepSeek Harness 并没有作为一个全局应用安装到电脑里。关闭运行它的终端,或者结束对应的进程,服务也就停止了,不需要再额外执行 npm uninstall。

如果此前是从 GitHub 克隆源码运行,则停止服务后,再删除本地的 deepseek-harness 项目文件夹即可。至于第三方桌面客户端,就和普通应用一样,直接从系统中卸载。

▲ 提示词:帮我在桌面制作一个deepseek harness本地桌面启动器,有一键打开和一键卸载的功能

而 DeepSeek Harness 留下的会话、配置和凭据也不准备保留的话,还可以继续删除 ~/.dsh 目录。

到这里,从安装、第一次任务、装 Skill、折腾插件,再到最后卸载,DeepSeek Harness 基本就算跑过一遍了。


DSH 说 15s 之后会重启,它自己还在输出,时间到了就重启完,重启之后成功安装了工作区目录树的插件

回头想想,这套流程里最有意思的变化可能还发生在 DeepSeek Harness 之外:我们可以让 Agent 帮忙安装 Harness,再让 Harness 给自己安装插件

以后折腾一个新的 AI 工具,需要记住的命令可能会越来越少,需要说清楚的只剩下一件事——我们到底想让 AI 做什么。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/fShqi9W
via IFTTT