2026年8月16日星期日

拒绝「差不多」,电商模型测评迎来「最严厉的父亲」

测评 AI 这件事,如今越来越难做了。

几年前,AI 还是聊天机器人时,测评主要就是做题:写作的、数学的、编程的……最后形成一套跑分,用分数代表模型能力。

但当 AI 从聊天框里走出来,变成能够调用工具、操作网页、处理文件、跨系统执行任务的 Agent,情况就变得复杂起来。

平时我们看到的,是 AI 出现在手机上,能够刷淘宝、加购物车,最后下单。实际上在商家的那一端,也有 AI 的参与,承担着比选购和下单更复杂的工作。

在专门考察电商环境中模型表现的 RealReplicaBench 测试中,经过 107 个真实商业任务的考核,所有参评模型都没有达到 60 分——都没有及格。

选手一共 13 位,但连同 GPT、Claude、GLM、Qwen 、Deepseek 和(毫无意外排名最末的)Gemini ,它们当中最高分只有 56.1 分。

 

以最高分的 Claude Opus 5 为例,在 Accio Work 执行框架中的通过率(66/107) ,要比 OpenClaw 上(60/107)和 PI (65/107)上的通过率更都要高,整体来看 Accio 框架对多数模型的性能增益都更明显。

执行框架来自阿里旗下Accio Work ,是全球首个聚焦于电商领域的 AI Agent,目标是帮商家在一个 AI 工作台上统一管理、自动操作、快速分析多个平台的店铺,降低门槛、提升效率,实现生意的增长。

RealReplicaBench 正是脱胎于 Accio Work 的技术团队,他们观察到,靠做题是看不出模型解决问题的真实能力的,尤其是在电商中,工作繁琐而具体:采购要从邮件和报价里确认信息,发品要处理图片、价格、物流和后台状态,经营分析要跨多个平台比对数据……

为了把货品准确无误地交到你手上,AI 已经卯足了劲,却未必做得够好,因为真实世界里的工作,很少是一连串彼此孤立的问题。

看似考做题,实则考「上岗」

如果只看分数,RealReplicaBench 的结果很容易引发误读:「怎么 AI 都不太行」。但摸着良心说,还真不能怪模型们不够强,这个结果很难简单归咎于模型能力——这套「题」,确实难。

传统 Benchmark 关注答对多少题、完成多少步骤,就获得对应的分数。类似于考高考,数学最后一道大题不会做,写个「解」字或把条件抄一下,也能拿点儿分。

可是当 AI 真正进入商业工作流以后,用户需要的不是一份过程尽力的答卷,而是一项项真正完成、且能够继续向下流转的工作。

对于「完成」的坚持,构成了 Accio Work 团队技术哲学的核心,这源于他们长期沉浸在电商场景里形成的判断,电商工作需要把判断转成行动,再让新的业务状态成为下一步行动的依据。

供应商有没有选对,决定后面的采购动作;价格有没有算对,决定商品能不能正常发布;物流路线是否满足时限,决定订舱有没有实际意义……前面的一次错误,可能沿着整个工作流一路传递到最后。

因此,重要的不只是某一步「做对了」,更在于每一步的判断和行动,能不能被完整串起来。

RealReplicaBench 对「完成」的定义也由此变得接近真实交付:一项工作只有在结果能够被下一环节直接接手时,才算真正完成。

技术负责人解释道,「哪怕一个任务已经完成了 80%,如果最后还留下 20% 需要用户手动处理,而这 20% 恰恰可能是最关键的部分,那么对用户来说,它依然没有形成可以直接使用的交付。」

基于这一点,在 RealReplicaBench 的测评中,不存在「将就」;没有完成,就是 0 分

如果一定要找一个更直观的比喻,传统 Benchmark 更像考交规,科目一,而 RealReplicaBench 更像路考。脑袋里知道什么时候该打转向灯是一回事,真正把车从起点安全开到终点又是另一回事。就算每一次转向灯都打对了,最后撞车了,也不能称作是合格的司机。

那么问题也随之而来,这种高完成度的表现,究竟要怎么被做成一套可重复、可验证的评测 benchmark?

为了测试「真实工作」,先造一个接近真实的世界

任何 Benchmark 都绕不开一个最基础的问题:它测到的,究竟是不是它想要测的东西。

如果目标是判断 Agent 能不能完成真实商业任务,那么只把一个真实需求改写成几段文字,再让模型输出答案,显然还不够。难点往往藏在那些被文字省略掉的地方:页面状态会变化,历史信息和新信息会冲突,系统之间的字段并不统一……

RealReplicaBench 的做法,是尽可能把这些复杂性搬到测试环境中,它不只提供题面,还复刻了前端 UI、浏览器操作、CLI、API/MCP、文件系统以及后台状态,让 Agent 面对的不是一张纸上的问题,而是一套能够被真正操作的业务环境。

供应商采购任务就是一个典型例子。Agent 需要从约 300 封高噪声邮件中还原真实采购需求,还要完成供应商选择、邮件标签、回复草稿和 Kickoff 日历。它测试的显然不再是「能否总结邮件」,而是能不能从一堆真实形态的噪声中还原业务事实,并把这个事实继续变成行动。

另一个更复杂的任务,则要求 Agent 把 5383 条海关记录变成一套跨系统采购控制塔。模型要先按品类和供应商聚合数据,再根据采购政策筛选 Top 3 供应商,随后分别在 Google Workspace、Box 和 Jira 中建立 Dashboard、证据文件夹和项目任务。

这类任务之所以可以作为考题,都在于它们保留了真实工作里一个很关键的特征:状态会不断变化,而 Agent 必须在变化中仍然准确理解上下文,并随之校准。

前面筛出来的供应商、后面创建的文件夹和 Jira Task,必须属于同一套业务关系。否则,一个动态 ID 写错,后面的交接和审计就可能全部失效。

因此,RealReplicaBench 所测试的,并不是模型在某一个单独的问题上能达到多高的正确率,这不符合他们的技术哲学,关键要看它能不能在复杂环境中持续维持正确状态,并把一个业务目标真正推进到结束。

用高仿真环境,证明高完成度

把真实环境复刻出来,还只是第一步,真实工作评测还有另一个容易被忽略的问题:模型可以说「任务已经完成」,而用户却无法确认,或者确认成本很高。

在聊天机器人中这问题不大,Chatbot 要交付的本来就是文本。可 Agent 不一样,它的文本输出只是行动过程中的一部分,因此 RealReplicaBench 的另一个核心设计,是让 Verifier 直接读取最终环境状态,而不是相信 Agent 的自我报告。

例如在物流履约中,Agent 需要为一票从中国到美国的运单枚举可行路线,把海运、拖车、尾程、保险、清关、Bond 和平台费全部计入,排除超过 30 天或港口衔接不成立的方案,再完成海运段 Booking 和 Shipment Verification。最终的验证对象不是一段看起来合理的路线建议,而是实际生成的 Shipment ID。

这套逻辑把「完成」的定义从模型的思维链中拿出来,交还给环境本身。Listing、Booking、日历、文件关系、动态 ID,这些真实状态共同构成了 Agent 是否完成工作的证据。

既然测评不该对一个只有「长得像答案」的答案给分,那么,每个动作都需要在环境里留下可以被独立验证的后果,这也是为什么 RealReplicaBench 判分格外严格的另一个原因。

Benchmark 背后,是技术实力

为什么Accio Work 团队能设计这样一套 Benchmark?

答案首先来自任务本身。RealReplicaBench 的 107 个任务并不是来自研究者想象中的「电商场景」,而是来自真实商业需求,来自约 160 万完整对话、20 万商业执行轨迹和 2000 条高价值工作流,最后通过可复现性与可判定性,收敛成 107 个任务。

供应商采购最后应该留下什么结果,商品发布什么时候才算真正完成,物流任务究竟停在路线建议还是必须产生 Booking,跨系统协作里哪些对象关系一旦断掉就无法继续交接——这些看似属于评分标准的问题,本身就建立在对真实业务流程的理解之上。

也因此,设计出什么样的 Benchmark,往往也会折射出背后的团队如何理解 Agent。

如果认为 Agent 只是一个更聪明的问答系统,测试自然会围绕答案质量展开;如果认为 Agent 的价值在于把工作真正推进到结束,那么测试就必须包含环境、工具、状态、验证以及失败后的归因。

从这个角度看,RealReplicaBench 表面上是在测试模型,背后实际上也展示了 Accio Work 团队设计 Agent 的一套方法论:从真实需求定义任务,再复刻工作环境;组织模型与工具完成任务,用环境状态验证结果,再根据失败位置持续优化模型与 Harness。

这也是为什么这套 Benchmark 对 Accio Work 的意义并不只是一次对外开源。团队计划持续加入新的真实任务,让评测环境滚动更新,并进一步用于模型评测、训练优化和模型路由。根据不同任务的特点,调度更适合的模型,在效果与成本之间寻找更好的组合。

这样一套 Benchmark 惠及的不只是电商商家,让他们能更准确地判断该选择什么模型、什么 AI 产品;也同样对整个技术社区有意义。

当 AI 真正开始进入商业工作流,建设 Harness 的能力会逐渐和底层模型本身一样重要。毕竟,对用户来说,真正值得付费的从来不是一个「差不多会做」的 Agent,而是一套能够把工作接过去,并把结果直接交回来的系统。

过去衡量大模型,人们最常问的是它知道多少;后来问题变成了它能不能推理。到了 Agent 时代,评价标准正在继续向前移动,逐步靠近它到底能不能把事情真正完成。

RealReplicaBench 正在把这个看起来很朴素的问题,变成一套可以重复运行、可以验证、也可以用于研发迭代的技术标准。Benchmark 测的是模型,最终被检验的,其实也是一个技术团队对「工作如何被 AI 完成」这件事理解得有多深。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/YWcBDnu
via IFTTT

早报|《牛来》主创回应排片暴增1900倍/卢伟冰:小米手机未来全面拥抱AI/问界儿童车即将上市

🚀

SpaceX 完成收购 Cursor,团队将加入 SpaceX AI

💰

Anthropic 第二季度营收超 115 亿美元,首次实现调整后运营盈利

📋

于东来:胖东来首批刑释员工无人离职,将再招 20 人

📱

小米手机 15 周年,卢伟冰称未来全面拥抱 AI

🤖

Dario Amodei:公众反对 AI,本质上是信任危机

🦿

2056 台机器人将同场比跳远、举重和拧螺丝

🌐

Booking.com CEO 也受够了旅行折腾,想让 AI 自动改行程

☁

千问模型半年下载量破 30 亿,Hugging Face 上超过 Google 与 Meta

🧠

清华与伯克利提出 ODEWorld,用连续时间轨迹指导机器人行动

🚀

Stripe 超 70 亿美元收购 OpenRouter

⚠

美国商务部长反对苹果采购中国内存芯片

💰

高盛开始为英伟达 5000 亿美元 AI 基建融资计划寻找投资人

💡

王祖贤回应 AI 形象授权:我们是用 AI,不是被 AI 用

🚙

问界儿童车即将上市

🔍

Anthropic 为 Claude 文本加入水印,并将开放检测 API

🔧

激光灭蚊「防空系统」开始量产,售价 988 美元起

⚡

GPT-5.6 Sol UltraFast 开放早期申请,最高每秒输出 750 tokens

🎬

《牛来》排片暴增 1900 倍,主创回应突然走红

大公司

SpaceX 完成收购 Cursor,团队将加入 SpaceX AI

Cursor 宣布,SpaceX 对其收购已经正式完成,Cursor 现已成为 SpaceX 的一部分。

Cursor 团队将加入 SpaceX AI,参与改进 Grok、Grok Build、Grok Bot、Grok API 和 Cursor 等产品。此前 SpaceX 已宣布行使收购选项,并称双方正在联合训练一款模型,计划用于 Cursor 和 Grok Build。

这次更新把交易状态从「拟收购」推进到「完成交割」。Cursor 的现有产品名称仍被列在后续改进清单中,官方暂未公布更多组织和产品调整细节。

Anthropic 第二季度营收超 115 亿美元,首次实现调整后运营盈利

据彭博社报道,Anthropic 向潜在投资者披露,2026 年第二季度初步营收超过 115 亿美元,较 2025 年同期的 7.87 亿美元增长至少 14 倍,也高于今年第一季度的 47.3 亿美元。文件还显示,Anthropic 当季首次录得正的调整后运营利润。

上述数字仍在审议,后续可能调整;Anthropic 拒绝置评。公司 5 月的年化营收运行率已超过 470 亿美元,彭博社称这一指标与 OpenAI 超过 400 亿美元的年化收入未必采用相同计算口径。

Anthropic 正在为潜在的大型 IPO 与投资者会面。彭博社此前报道,公司已秘密提交上市申请,并与摩根士丹利、高盛和摩根大通合作推进 IPO;若今年秋季完成上市,时间将早于 OpenAI 和 DeepSeek 正在准备的上市计划。

于东来:胖东来首批刑释员工无人离职,将再招 20 人

8 月 15 日凌晨,胖东来创始人于东来在社交平台发文称,首批刑释人员进入岗位后「没有一个离开」,目前都在稳定工作和生活;他同时表示,公司准备再招聘 20 名刑释人员。于东来暂未说明新一轮招聘的岗位、门店和时间安排。

胖东来在 2025 年首次公开定向招聘刑释人员。最初计划录用 20 人,面试后实际录用了 30 人,并为入职者设置 6 个月双向选择期。于东来当时称,希望给已经承担法律责任的人重新融入社会的机会。

小米手机 15 周年,卢伟冰称未来全面拥抱 AI

8 月 16 日是小米手机发布 15 周年。小米集团合伙人、总裁兼手机部总裁卢伟冰发文回顾称,小米手机从最初的「为发烧而生」走向全球市场,下一阶段将全面拥抱 AI。

第一代小米手机于 2011 年 8 月 16 日发布。市场研究机构 Omdia 的数据称,小米 2025 年智能手机出货量为 1.654 亿部,市场份额约 13%,连续 5 年位列全球前三。小米接下来会如何把 AI 战略落到手机系统、端侧模型和跨设备体验,仍要看具体产品更新。

Dario Amodei:公众反对 AI,本质上是信任危机

据 TechCrunch 报道,Anthropic CEO Dario Amodei 在一组公开帖文中回应投资人 Gavin Baker。Baker 认为,Amodei 对 AI 风险的持续警告加剧了美国公众的反弹,并削弱了行业争取监管支持的能力。

Amodei 否认自己的公开表达只强调风险。他说,自己的文章对风险与收益投入了大致相当的篇幅,撰写「Machines of Loving Grace」正是因为 AI 行业没有充分说明技术能给社会带来的积极变化。

> 公众对 AI 的负面态度,本质上是信任危机。

他认为,人们不信任公司、政府和科技行业,怀疑企业会利用新技术损害他们的利益;AI 公司至今没有兑现改善世界的宏大承诺,是最准确的批评。承诺「AI 将治愈癌症」已经成为套话;他表示,只有实际取得这样的科学成果,才会改变公众态度。

在监管问题上,Amodei 反对把选择简化为「无监管地广泛分发 AI」或「通过监管把能力集中到少数公司」。他认为,前沿 AI 天然倾向于集中权力,开放权重只能把集中点转移给掌握最多算力和芯片的人;Anthropic 的政策提案因此试图同时约束前沿公司、降低网络安全和生物风险,并为小型竞争者和开放权重模型保留空间。

2056 台机器人将同场比跳远、举重和拧螺丝

第二届世界人形机器人运动会将于 8 月 22 日至 26 日在北京国家速滑馆举行。北京市政府新闻发布会公布,本届赛事吸引来自六大洲、16 个国家的 666 支队伍,共有 2056 台机器人参赛;队伍数量较首届增长 138%,机器人数量约为首届的 4 倍。

赛项由首届的 26 项增加至 51 项,比赛场次从 487 场增至 1301 场。竞技赛新增跳远、举重、拔河和乒乓球,百米、足球和舞蹈项目也会继续举行;机器人足球将加入带球跑动和大力抽射,舞蹈则首次设置由两台机器人完成的华尔兹与桑巴。

工业、酒店、家庭和物流等场景赛新增灵巧手项目,机器人要完成夹豆子、拧螺丝等 8 项「微操」。与上届单机完成任务不同,本届场景赛会让两台机器人同场比拼效率和可靠性。

Booking.com CEO 也受够了旅行折腾,想让 AI 自动改行程

Booking.com CEO Glenn Fogel 接受《华尔街日报》采访时说,航班延误、长时间困在停机坪以及客服等待,让他有时也会怀疑一趟旅行是否值得。Booking.com 及旗下 Priceline、Kayak 和 OpenTable 正把 AI 视为减少这些摩擦的工具。

Fogel 设想,未来的旅行助手不仅能回答问题,还能根据天气主动判断游船和博物馆行程是否需要对调,先征求用户同意,再自动完成改签。这个目标目前仍是产品方向,而不是已经普遍上线的完整能力。

千问模型半年下载量破 30 亿,Hugging Face 上超过 Google 与 Meta

阿里巴巴称,千问模型家族过去 6 个月在各个平台的累计下载量已超过 30 亿次。Hugging Face 的最新统计显示,千问在该平台同期下载约 20.45 亿次,高于 Google 的约 4.18 亿次和 Meta 的约 2.27 亿次。

千问目前已公开超过 460 个模型,并衍生出大量社区微调版本。Hugging Face 的开源模型报告也把千问列为衍生模型数量领先的家族。不过,下载次数包含重复下载,也不覆盖闭源 API 和私有部署,因此更适合衡量开源生态活跃度,不能直接等同于真实用户数或模型质量排名。

清华与伯克利提出 ODEWorld,用连续时间轨迹指导机器人行动

据 MIT 科技评论中文网报道,清华大学智能产业研究院与加州大学伯克利分校团队提出连续世界模型 ODEWorld。它不再只根据当前画面预测下一帧,而是用物理时间流 PT-Flow 学习状态随真实时间变化的方向和速度,让模型可以推演两个观测帧之间没有被拍下的中间状态。

ODEWorld 先用 DINOv2 提取图像特征,再把相对稳定的背景和初始状态与动态信息解耦。模型通过雅可比向量积把图像变化映射到压缩空间,并由常微分方程求解器累积变化,因此既能预测任意时间点,也能反向推演过去状态。在 64 帧长程预测中,它在单张 A100 GPU 上的延迟为 0.072 秒,V-JEPA 2 和 LDP 分别为 0.619 秒和 3.953 秒。

研究团队把连续轨迹转成一组隐空间子目标,作为机器人执行长任务时的「中途路标」。在 LIBERO-LONG 的 10 项任务中,连续子目标方案平均成功率为 83.6%;部署到真实双臂机器人后,夹虾入锅、鼠标收纳、插笔和双臂整理物体 4 项任务的平均成功率从 55% 提高到 80%。团队表示,当前模型尚未处理接触、碰撞、摩擦和力等更复杂的物理规律。

Stripe 超 70 亿美元收购 OpenRouter

据彭博社报道,支付公司 Stripe 已敲定收购 AI 模型聚合平台 OpenRouter 的协议,交易价格超过 70 亿美元。报道援引知情人士称,OpenRouter 数月前融资时的估值为 13 亿美元;Stripe 暂未公开回应交易细节。

OpenRouter 为开发者提供统一接口,可按任务、价格和性能在不同 AI 模型之间切换。公司今年 5 月完成 B 轮融资时称,平台拥有 800 万名全球用户,可访问 400 多款模型;创始人 Alex Atallah 将其定位为 AI 模型领域的「Stripe」,希望减少开发者对单一模型供应商的依赖。

Stripe 与 OpenRouter 上月已被曝进入收购谈判。彭博社此次将交易状态更新为「已敲定协议」,并把对价提高到 70 亿美元以上。

美国商务部长反对苹果采购中国内存芯片

据《华尔街日报》报道,美国商务部长 Howard Lutnick 接受采访时表示,特朗普政府不希望苹果从中国采购内存芯片;报道同时称,苹果仍可能推进相关采购。

AI 数据中心建设推高了内存需求,导致供应紧张和价格上涨,苹果及其他消费电子厂商已经面临更高的元件成本。为缓解供应压力,苹果正评估中国厂商提供的内存芯片。

Lutnick 的表态把苹果的供应链选择再次带入美国政府审查范围。苹果尚未公布最终供应商名单。

高盛开始为英伟达 5000 亿美元 AI 基建融资计划寻找投资人

据路透社报道,高盛正在接触潜在投资人,希望参与英伟达规模超过 5000 亿美元的 AI 基础设施融资计划。英伟达 8 月 10 日宣布与 Apollo、贝莱德、黑石、Brookfield、高盛和 KKR 合作,由六家机构分别建立融资平台,为购买 GPU、建设数据中心的客户引入第三方长期资本。

这些平台并非由英伟达一次性投入 5000 亿美元,而是计划逐步汇集保险公司、养老金、主权财富基金等机构资金,并以 GPU 和算力基础设施等资产支持融资。英伟达希望借此降低客户部署算力的资金门槛,高盛则凭借与英伟达的长期关系获得了六个平台中的一个席位。

路透社称,高盛已开始讨论具体参与方式;相关结构把 AI 算力从企业资本开支进一步带入信贷市场,也让芯片折旧、设备残值和算力需求成为投资人需要评估的核心变量。

💡 王祖贤回应 AI 形象授权:我们是用 AI,不是被 AI 用

8 月 15 日,在网易游戏《天下》18 周年玩家生态大会的公开发言与圆桌对话中,王祖贤现身交流,首次公开回应为何接受 AI 数字影像短片《倩影》的形象授权,并分享了她对经典作品、技术边界与人机关系的看法。

面对外界关于 AI 生成形象与真人演绎差异的争议与关注,短片《倩影》采用「王祖贤授权 AI 形象出演、配音演员苏柏丽配音」的方式制作,展现了黑发至白发跨越时光的数字形象。王祖贤表示,从黑发到白发的变化让她感受到岁月感,但这次合作不仅是让过去的银幕形象重现,更是让留在观众记忆里的经典作品借助新媒介与当下重新连接。

谈及为何愿意授权与人机边界,王祖贤指出,经典始终在那里,AI 带来的是另一种观看和表达的可能,希望外界给新技术更多探索空间:

> 其实我没有想太多。我觉得新的世界必须要有新的东西,旧的世界也很好,它也会成为新世界的根基。但是我们是用 AI,不是被 AI 用。

她强调,AI 技术可以让观众多一种选择,但无论尝试何种呈现形式,希望借此表达什么最终仍然应该来自人的主动决定。同台制作人也回应称,无论出现怎样的新艺术形式,使用一个人的形象都必须以获得本人同意为前提,故事与情感内核依然取决于人的判断。

新产品

问界儿童车即将上市

鸿蒙智行问界汽车 8 月 16 日发布预热海报,宣布问界儿童车即将上市。产品由赛力斯汽车与华为联合设计,主打「成长陪伴,智趣探索」。

官宣海报显示,这款儿童车采用双座敞篷布局,外观延续问界 M9 的家族设计,前挡风上方还设置了摄像头。因为整车像按比例缩小的问界 M9,不少网友称它为「M0.9」。

问界尚未公布这款儿童车的售价、具体配置和确切上市时间,当前口径仍是「即将上市」。

Anthropic 为 Claude 文本加入水印,并将开放检测 API

据 The Decoder 报道,Anthropic 将为 Claude 生成文本加入水印,并提供检测 API,允许第三方应用检查一段文本是否可能由 Claude 参与生成。其方案基于 Google DeepMind 公开的 SynthID Text 方法,通过调整选词时的随机数源,在文本中留下可追踪模式。

水印对短文本、事实密集段落和代码的识别效果较弱;完全由人类选词的校对任务不会带水印,重度改写也可能移除水印。检测结果只能说明 Claude 可能参与创作,无法判断整段内容由 Claude 独立完成还是只经过编辑,也不能识别其他模型。

Anthropic 为遵循欧盟《人工智能法案》和生成内容透明度实践准则,将在全球启用这项能力。2025 年 8 月 2 日之后发布的模型已具备水印支持,旧模型将在未来数月加入;图片等文件则使用 C2PA 元数据标准。

激光灭蚊「防空系统」开始量产,售价 988 美元起

Photon Matrix 宣布激光灭蚊设备进入量产,首批产品计划于 8 月下旬发货。面向室内的红外激光版售价 988 美元,蓝激光版售价 1088 美元,均已在官方商店开放购买。

设备用激光雷达持续扫描背景距离,当 2—20mm、移动速度不超过 1m/s 的飞行目标进入约 6 米半径和 90 度扫描范围时,系统会确认目标尺寸,再沿同一光路发射短脉冲激光破坏蚊虫翅膀。若背景超出有效范围、没有实体背景,或目标尺寸明显大于蚊虫,激光不会启动。

蓝激光版灭蚊效率更高,但夜间可见光可能干扰室内使用;红外版的激光不可见,更适合卧室和育儿空间。官方表示,约 4500 份订单正在排队等待交付;产品的实际识别率、安全性和长期稳定性仍需要量产设备的独立测试验证。

GPT-5.6 Sol UltraFast 开放早期申请,最高每秒输出 750 tokens

OpenAI 正在为 GPT-5.6 Sol 的 UltraFast 模式开放早期访问申请。官方介绍称,该模式由 Cerebras 支持,最高可生成每秒 750 个输出 token,速度最高为标准模式的 14 倍。

UltraFast 面向实时或接近生产环境的工作负载,官方列出的场景包括实时语音、客户支持、商务、开发智能体、金融研究和安全响应。

当前容量仍然有限。OpenAI 会根据工作负载的匹配度和可用容量评估客户,待容量扩大后向申请者发送更新。

Miora 上线连接器,可读写 Notion、腾讯文档和 GitHub

腾讯设计妙境 Miora 上线连接器功能,授权后可直接从外部工具读取文档、需求和表格,并将生成的内容写回原有工具,无需在多个窗口间重复复制粘贴。

目前内置的 7 款连接器分为三类:Notion、腾讯文档和 Airtable 负责提供资料;Linear 与 GitHub 可接收任务、需求和代码仓库结果;Resend 与 Brevo 可发送邮件、短信并管理营销触达。连接后,Miora 可执行读取、写回、新建和发送四类操作。

此外,用户还可添加符合通用接口标准的自定义连接器,并在外部平台的授权页面选择开放范围。官方展示的工作流包括从 Notion 取出灵感文档后生成视频,以及联动 Notion、腾讯文档、GitHub 和 Resend 完成电商营销方案与物料投递。

兰博基尼 Revuelto SV 发布:1050 马力,2.4 秒破百

据 The Verge 报道,兰博基尼发布 Revuelto SV。SV 代表 Superveloce,这款车延续 6.5 升自然吸气 V12 与三电机混动结构,综合输出约 1050 马力,比标准版增加约 50 马力。

  • 电池容量增加 7.3kWh,使赛道连续高负载时的输出更稳定;
  • 变速箱换挡时间缩短 30%,大量使用碳纤维后,功率重量比从标准版的 1.75kg/CV 改善至 1.66kg/CV;
  • 新前保险杠和后翼把下压力提高 80%,车头下压力增加一倍,0—100km/h 加速为 2.4 秒;
  • 新增源自 GT 赛车的 Pilota 模式,驾驶者可用方向盘旋钮在五档稳定系统介入程度之间切换。

Revuelto SV 还采用更厚、更大直径的 CCM-R Plus 制动盘,并用六维传感器读取车辆纵向、横向、垂向加速度及俯仰、侧倾等姿态。兰博基尼取消纯电跑车计划后,继续以混动系统承担扭矩矢量控制和动态性能提升。

起亚 EV3 美国起售价低于 3.1 万美元,续航最高 321 英里

据 Engadget 报道,起亚公布 EV3 在美国的定价:车辆起售价为 29450 美元,加上 1495 美元目的地费用后为 30945 美元,低于公司今年 4 月提出的 3.5 万美元目标,也成为起亚在美国最便宜的纯电车型。

EV3 提供前驱和四驱版本,纯电续航最高 321 英里,车身尺寸接近起亚 Niro,并沿用 EV9 的设计元素。车辆配备 NACS 充电口,可使用特斯拉超级充电网络;起亚称,在 350kW 直流快充下,电量从 10% 充至 80% 约需 31 分钟。

Hermes Agent 加入 `/loop`,可在当前会话定时重复任务

Nous Research 为 Hermes Agent 加入 `/loop` 循环命令。用户可以让 Agent 在当前会话中按固定间隔重新执行一段提示词或斜杠命令,用于轮询部署状态、监控 CI、反复修复测试,或在长会话中定期做状态摘要。每次唤醒都是一个新的 Agent 回合,会重新读取当前状态后执行任务。

`/loop` 提供固定间隔和自适应两种节奏。自适应模式从默认 1 分钟开始,回复没有变化时依次退避到 2、4、8 分钟,上限默认为 15 分钟;一旦状态变化,立即回到最短间隔。用户还可以设定执行次数、证据型停止条件,或让 Agent 在任务完成时输出 `LOOP_COMPLETE` 自动结束。

这项功能存活于当前会话,可跨越会话恢复和上下文压缩;需要隔夜、端末重启后继续或无人值守的定时任务时,官方建议改用 cron。

Liquid AI 推出本地隐私过滤器 ShieldFlow

Liquid AI 推出 ShieldFlow 早期试用版。它作为本地代理运行在电脑上,在提示词发送到 AI 服务前检测并替换姓名、身份证号、信用卡、API Key、医疗信息和地址等敏感内容,收到回复后再在安全范围内恢复上下文。检测、删改和日志都留在本机,支持 ChatGPT、Claude 和 OpenRouter 等服务。

ShieldFlow 支持 40 多种敏感实体,每个分类可独立开关并调节检测灵敏度。Liquid AI 同时在 Hugging Face 公开 LFM2.5-Encoder-350M-PII-Detector:该 3.5 亿参数模型面向 token classification,覆盖 11 个领域的 40 种个人信息类型和 16 种语言,可在 CPU 环境中运行。

ShieldFlow v0.4.3 个人版免费,支持 Apple Silicon Mac 与 Windows 10/11,应用和分类模型约占 500MB 磁盘空间,运行不需要 GPU。

Suno Studio 2.0 加入 MIDI 编辑与 AI 插件生成

据 MusicRadar 报道,Suno 已推出浏览器端数字音频工作站 Studio 2.0,在生成式音乐能力之外补入 MIDI、参数自动化和延迟补偿等传统制作工具,并新增可直接控制项目的 Studio Chat。

新版允许用户在时间线或独立编辑器中导入、录制和修改 MIDI,也能把音频转换为 MIDI。反向操作时,Suno 的生成引擎可把 MIDI 片段转换为指定乐器、音色或风格的音频,同时保留原始音高、节奏和力度;Studio Chat 还可以根据文字指令生成旋律、和弦与鼓点。

每条轨道现在都有横向通道条,可加载内置 Wavetable 合成器,以及混响、延迟、压缩、失真、均衡器和噪声门等效果。Studio Chat 可以生成声音、整理工程、编辑 MIDI 与音频,并按提示制作自定义音频效果;Studio 2.0 已向 Premier 订阅用户开放。

新消费

共享充电宝「撞脸」主流品牌,误还后还要交跑腿费

据中央广播电视总台中国之声报道,一些小品牌共享充电宝开始模仿主流品牌的机柜颜色和外观,并紧邻主流品牌设备摆放,让消费者在扫码时产生误认。

四川消费者甘女士借用一款外观近似主流品牌的共享充电宝,归还时才发现设备属于另一平台。客服要求她支付 30 元跑腿费取出误还的充电宝,或自行拆取;第二天她准备按网上教程取出时,设备已经不见,平台随后以「遗失」为由要求支付 99 元。

一名共享充电宝从业者称,部分机柜换成与主流品牌相似的黄色后,使用率可从约 20% 提高至 40%。中国政法大学知识产权研究中心特约研究员赵占领表示,颜色本身未必能注册为商标,但模仿包装、弱化真实经营者并诱导误认,可能构成混淆行为;误借误还后持续计费或收取买断费,也可能侵犯消费者的知情权和自主选择权。

《塞尔达传说》40 周年 Switch 2 手柄包装曝光

消息人士 @XX_750000 分享的照片显示,一款《塞尔达传说》40 周年主题 Switch 2 Pro 手柄已经出现正反面包装;同一批照片中还有一个尺寸接近手柄包装、但被打码的第三款任天堂产品。

此前流出的包装还包括黑金配色、带有三角力量标志的限定 Switch 2 主机。目前任天堂尚未公布这套硬件,也没有确认图片真伪、发售时间、售价以及是否会与《塞尔达传说:时之笛》重制版同步推出。

好看的

《牛来》排片暴增 1900 倍,主创回应突然走红

《牛来》反向走红后,影片官方抖音账号回应称,导演一直有一个电影梦,这部片由两个人完成,因此坚持要上院线,后来由朋友帮忙进入院线。团队表示没有想到观众会抱着猎奇心理关注影片,并向观众致谢。

灯塔专业版数据显示,影片 8 月 5 日上映后的前 10 天累计票房仅 1.1 万元,全国日排片一度降至 6 场;到 8 月 17 日早间,累计票房已突破 900 万,排片增至 12011 场,较最低值增加超过 1900 倍。

影片粗糙的 3D 建模、卡顿动作与精致水墨海报形成反差后,社交平台出现大量玩梗和 AI 二创。微博话题「AI 复刻牛来」下,网友用 AI 重做片段,并把复刻版与主创手工制作的原版并排比较。

制作团队同时发布声明,提醒多个社交平台出现冒充官方团队的账号,部分账号未经授权发布信息甚至开展商业活动。团队列出的唯一官方账号均使用「牛来电影官方团队」名称,并表示将追究冒用者的法律责任。

《蜘蛛侠:崭新之日》延长放映至 9 月 28 日

「蜘蛛侠系列电影」官方微博宣布,漫威与索尼联合出品的《蜘蛛侠:崭新之日》将延长放映至 9 月 28 日。官方同时称,影片目前观影人次已超过 3400 万。

影片由德斯汀·丹尼尔·克雷顿执导,汤姆·赫兰德、赞达亚、萨迪·辛克、乔·博恩瑟和马克·鲁法洛等出演。延期后,影片将跨过暑期档继续留在院线,具体排片由各地影院安排。

《魔发奇缘》真人版定档 2028 年 3 月 31 日

迪士尼在 D23 全球粉丝大会上宣布,真人版《魔发奇缘》将于 2028 年 3 月 31 日在北美上映,并在现场首次播放先导预告、公开主演造型。影片已于今年 6 月在西班牙开拍。

蒂根·克罗夫特饰演乐佩,麦洛·曼海姆饰演弗林·莱德,凯瑟琳·哈恩饰演葛朵妈妈,迭戈·卢纳将出演真人电影新增角色。影片由《马戏之王》导演迈克尔·格雷西执导。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/GtNPcud
via IFTTT