2026年10月4日星期日

十年前的「外挂相机」,如何在华为 Mate 90 上复活?|硬哲学

Image

十几年前,模块化一度被视作智能手机最性感的未来之一。

2013 年,摩托罗拉公布 Project Ara:一块「骨架」上,处理器、屏幕、电池、传感器都可以像积木一样拆装。既然电脑可以自己换显卡、内存和硬盘,为什么手机不能?

相信很多人的第一反应也和我一样:既然什么都能换,那如果给手机装上一套更大的镜头和传感器,是不是就能得到一张媲美相机、甚至单反的高画质照片?

Image

图|Dezeen

许多厂商也抱着类似的期待,做过不少尝试。只不过从最终的市场表现,以及真正用起来的体验来看,这些尝试大多没能成为主流。

此后的十几年里,手机影像却以另一条路线飞速发展。

更大的传感器、更长的潜望长焦、更复杂的光学结构,加上计算摄影,手机可以拍出十几年前几乎难以想象的照片。

但物理尺寸仍然是手机摄影难以逾越的边界。所以我们能够看到增距镜这种产物的出现,虽然主要的场景可能还是在演唱会,不过其本质还是——把手机里塞不下的东西,重新放到手机外面。

也就在 2026 年这个节点,华为也给出了他的答案:睿影 Z10 模块相机。

把相机挂在手机上

只看外形的话,睿影 Z10 很像一只体积夸张的手机增距镜。

但两者其实不是一类东西。

增距镜的工作,是在手机已有镜头前再增加一组光学结构,通过改变等效焦段,让原本的长焦看得更远。无论外挂的镜片有多大,真正负责成像的传感器、镜头和图像处理链路,依旧属于手机原本的那颗摄像头。

Z10 不一样。

它的外接模组里,本身就有一颗完整的传感器,以及一套独立的变焦镜头。

所以要简单理解 Z10 这个模组的存在,最合适的方式就是把他看作一台「一分为二的卡片机」——

镜头和 CMOS 留在外挂模组里,负责手机机身最难妥协的光学和感光;显示、操作、计算、存储以及分享,则交给手机。

Image

图|索尼黑卡 RX100 VII

细看参数,这种「似是故人来」的感觉会更明显。

Z10 使用一颗 1 英寸、5000 万像素的 RYYB 传感器,配备一套覆盖 24mm 到 240mm 的 10 倍连续光学变焦镜头,最大光圈 F2.0-F4.5。

作为参照,索尼黑卡 RX100 VII 同样使用 1 英寸传感器,有效像素约 2010 万,镜头覆盖 24-200mm,最大光圈 F2.8-F4.5。

当然,这只是参数上的近似,只不过我们也大概能品出 Z10 的价值:

它像是把一台索尼黑卡相机最核心的光学和感光部分拆下来,挂到了手机背后。

在我们的上手体验中,这套覆盖 24mm 到 240mm 的连续光学变焦,带来了明显更大的焦段选择和构图自由。

独立的一英寸传感器,再配合这套镜头本身的光圈和中长焦焦段,在拍摄人像或近距离特写时,也更容易直接获得自然的光学虚化。

这样的体验是我们在手机摄影上难以企及的。

向左滑动查看更多内容

仔细想,这其实是一个挺合乎逻辑的分工。

今天的旗舰手机已经拥有非常强的计算能力、足够好的屏幕,以及成熟的操作系统、联网、存储和内容分发能力。

尤其是在今天这条轻量化的影像处理与分发链路里,从拍摄、简单编辑到发布,手机相比传统相机「拍摄—拷卡—导入—修图—导出」的流程,不能说更加专业,但几乎一定更加直接,也更加省事。

光学需要空间,传感器需要面积,这是最难以被手机替代的部分。

于是 Z10 选择把这些最受手机体积限制的部分放到外面,把手机已经非常擅长的事情继续还给手机。

Image

最终,Z10 的影像模组就能够通过 HyperClick 超级卡口安装在华为 Mate 90 Pro Max 典藏版以及非凡大师两款手机的机身背部,借助接口与手机完成连接和数据交互。

不过其实在去年的 MWC 上,小米也展示了一个类似的方案。它同样在改装版小米 15 背板中央加入连接结构,通过触点与 LaserLink,让一套搭载 M4/3 传感器和 35mm F1.4 镜头的独立成像模块接入手机的影像系统。

形态不同,但核心的解法还是十分类似:把一套位于机身之外的独立成像系统,连接到手机上。

其实在这款产品刚亮相时,我就觉得,它或许代表了移动影像接下来值得探索的一条路径。

只是后来,小米并没有继续推动它走向量产,这套镜头最终还是停留在了概念阶段。

华为在这个基础上再进了一步——

在做出了一套外接相机模组之外,还把与它配套的硬件设计,真正写进了一台量产旗舰的产品定义里。

Image

图|小米

镜头式相机,等了手机十年

其实不只前文提到的小米,在模块化,或者说外置影像模组这条路上,过去已经有不少厂商前仆后继。

事实上,如果只是想把一颗大底传感器和一支好镜头挂到手机上,索尼真的就拿黑卡做过实验。

2013 年,索尼就推出过 QX100——这是一个镜头式相机(Lens-Style Camera),配备一英寸传感器、3.6 倍光学变焦镜头,甚至还有独立处理器、电池和存储。可以说,当年索尼就是将一台 RX100 黑卡相机做成了可以外挂在手机上的样子。

Image

图|索尼 QX100

再往后,索尼还推出了迭代机型 QX1,甚至直接用上了 APS-C 传感器和 E 卡口。

除了索尼,OPPO 也曾推出过形态相近的 O-Lens 1,把自带传感器和变焦镜头的相机夹在手机上,再通过 Wi-Fi 连接。几年后的摩托罗拉则更近了一步,它把哈苏相机模块接进了手机的供电、操作和存储流程,已经有了较完整的硬件整合。

Image

图|OPPO O-Lens 1 和 Hasselblad True Zoom

不过把目光回到 2013 年的索尼,这仍然是挺令人惊叹的,毕竟在遥远的 13 年前,索尼就已经提出了与现今颇为相似的产品形态。

不过,这些早期外挂相机采用的是一种很直接的思路——

把完整的成像链路都留在外挂相机这一端。

传感器产生的原始数据,先在相机内部经过 ISP (图像信号处理器)处理,再进行编码和压缩。实时取景时,手机接收到的已经是经过处理和压缩的预览画面;拍照完成后,再把 JPEG 等成片传给手机。

换句话说,手机并没有真正参与成像。它更像是一块无线监视器,负责显示取景画面、发送拍摄指令,以及接收最后的照片。

当年摄影媒体 DPReview 评价,如果只是从「光学成像」这个角度来看待这个产品,QX100 并没有太明显的短板。

当然了,只是成像层面。

Image

图|索尼 QX1

镜头式相机的问题显而易见,别忘了,那还是 2013 年——

彼时 4G 才刚刚开始进入普通人的生活,整个移动互联网和无线传输环境都还处在相对早期的阶段;智能手机的性能、无线连接的稳定性,是远不能和今天相比。

QX100 想做的,却是让两台独立设备通过 Wi-Fi 协同工作,并在体验上尽可能接近原生摄像头。在当时,这几乎是天方夜谭。

所以即便相机与手机之间传输的已经是数据量更低的预览画面,延迟依旧十分明显。

当连接需要等待,取景可能有延迟,照片传输也需要时间,这种割裂感注定让产品使用的体验大打折扣,更何况是对于手机摄影这种即时性要求很高的场景。

另一重限制来自于:手机本身,并不处在真正的成像链路里。

彼时手机本身的算力有限,ISP、GPU 乃至后来越来越重要的 NPU,都还远没有发展到今天的程度。

与其把庞大的传感器数据实时送进手机,再要求手机完成后续计算,不如先让相机自己把照片处理好,再把结果交给手机,会是更现实的选择。

到了今天,这个前提已经完全不一样了。

各种旗舰手机的算力甚至达到了一种「过剩」的状态。过去需要交给独立相机处理器完成的不少工作,如今手机自己的 SoC、ISP 和 NPU 已经能够接手,没有必要再把完整的成像计算全部留在外挂模块里。

Image

而比「算得动」更重要的,是过去十几年移动影像发展出来的另一套摄影体系:

计算摄影。

它本就是手机在有限体积下,对物理光学不足的一种补偿。于是有了 HDR、多帧融合等等,厂商们开始用算法去榨取有限光学硬件能够提供的信息。

Image

外接影像模组的出现,让这件事情有了一个很有意思的变化。

当一颗更大的传感器、更完整的镜头和更长的光学结构被放到机身之外,这套本就已经高度成熟的计算摄影体系,反而能够获得质量更高的「原材料」。

更好的光学输入,加上相当成熟的计算摄影,二者协同而不是相互取代,光学成像和计算摄影在这里实现了叠加。

外挂模组可以直接利用手机已有的色彩、HDR、多帧、降噪和 AI 影像能力,不必自己从头建立一套完整的移动摄影管线。

从另一个角度来看,当更多计算被手机接手,外挂模组能够更集中地承担自己真正不可替代的工作——光学和感光,将有限的空间留给更大的传感器、更好的镜头,以及更复杂的变焦机构。

从 Z10 的相关专利也能看到这样的思路:

模块向手机提供的,可以是供后续成像处理使用的图像数据,而不只是已经在模块端处理、压缩好的预览数据。这样一来,手机才能更深地参与后续的色彩、降噪、HDR 等计算。

Image

不过,既然手机需要参与到成像中,也就意味着,传感器产生的数据,需要足够快地送进手机。高速传输因此成了这套架构里最关键的一环。

2025 年小米展示模块化光学系统时,就特别强调,能够通过 LaserLink 实现 10Gbps 光学数据传输,并让外接模块直接调用手机端的 AISP。

Image

华为 Z10 走的也是类似方向。

从我们的实际上手来看,Z10 在取景和操作过程中并没有表现出明显的传输延迟。至于它具体用了多大的数据带宽,华为目前并没有公布明确规格。

不过在 Z10 相关专利中可以看到,在部分实现方式下,模块相机向主机设备传输图像数据的速率可以达到或超过 10.7Gbps,以满足大数据量图像信号的传输需求。

所以,华为选择在这个时间点把 Z10 推向市场,已经不能说是一种激进的冒险,更像是在一个已经成熟的技术环境里,水到渠成地落地成一款产品。

Image

手机不会「杀死」相机,但手机可以「成为」相机

不过,尽管 Z10 已经走向量产且技术方案成熟,但这依然是一次小众尝试。

毕竟,接近 6000 元的价格,以及绑定典藏版、非凡大师等高端机型,其实已经能够看出,在现阶段这大概率不是一个追求巨大出货规模的大众配件。

华为更像是在高端市场里,先为这套新的产品形态寻找一个落脚点。

Image

抛开价格因素,我想更值得更值得讨论的是这个产品上市本身——这不再只是一个技术问题,而是一个市场问题。

差不多十年前,手机就已经取代相机,成为最流行的拍照工具。按照这条路径继续发展下去,除了专业用户,普通人似乎没有再额外带一台相机出门的必要。

但现实并非如此——

过去十年,我们看到了不少新相机品类冒头以及经典便携相机的回潮,无论是大疆影石,还是富士理光,这些产品的形态、价格和画质取向各不相同,不过它们其实都在兑现一件事情:出片承诺。

消费者不一定在意里面到底是几英寸的 CMOS、用了几组镜片。我们真正购买的,是一种出片的确定性——

是一种「我带上这个东西,到了某个场景,它能让我更容易拿到想要的照片」的确定性。

当下各家的增距镜能够占据演唱会看台的每一个角落,Pocket 到了国庆这样的旅行旺季甚至会出现租金上涨,本质上都来自同一种需求。

这本质上是一次交换。

为了某一种特定的影像质感,或者为了拍到原本很难拍到的画面,我愿意多带一个设备。

这也为 Z10 提供了十年前那些产品不曾拥有的市场土壤。

技术已经准备好了,人们也更清楚,自己愿意为什么样的画面付出额外成本。

那个曾经太早出现的想法,这一次,可能终于等到了属于它的时代。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/IFzYawH
via IFTTT

OpenAI元老的一封离职信,揭开了奥特曼最不想承认的真相

如果说现在形容一件事很厉害,最常见的用词不是「牛 X」,而是「瘫坐在地,仿佛看到了核爆炸。」

Image

这几乎成了 OpenAI 这家公司的「企业文化」,成了整个 AI 圈模型发布的一个梗。

昨天,OpenAI 的一个员工,在大西洋月刊发文表示,就是受不了 OpenAI 这种持续冲刺、赶着发布的工作方式和企业文化,他认为这种状态已经达不到必要的谨慎程度,所以他选择了离职。

这名员工叫 David Robinson,他负责安全团队透明度工作,主导起草了 OpenAI 现行的《Preparedness Framework》(防备框架),并监督了 12 次前沿模型发布的安全报告。

Image

图|https://ift.tt/K8FnkPI

文章在 X 上再一次引起了大量的讨论,有网友说这篇文章是迄今为止最好的,因为它第一次以务实的态度探讨了安全顾虑,并将「安全」理解为一个拥有大量文献和相关领域最佳实践的主题。

也有网友表示,应该要立下一条规则,那就是所有「我因为良心不安离开某 AI 公司」的帖子,都必须披露作者持股多少、套现多少。

等你和你子子孙孙都不用为钱工作了,道德指南针突然就找到了。

在 Hacker News 上,还有人更刻薄的评论这件事,「我在 AI 行业赚够了钱,现在我可以畅所欲言地评论 AI 了。」

而在 David Robinson 这份离职信之前,华尔街日报在 10 月 2 日就曾报道过 OpenAI 有三名对准/安全研究人员离职。

OpenAI 发言人表示,「我们已与三名员工解除合作关系,原因是他们违反了我们关于访问和处理公司敏感信息的政策。我们的调查证实,这些人未经公司既定程序便不当处理了敏感信息,违反了我们的政策,破坏了我们工作所必需的信任。」

Image

一时间众说纷纭,7 月就已经离职的 OpenAI 首席未来学家 Joshua Achiam 发文认为 OpenAI 公开的信息不够,

虽然我不认为安全研究人员应该拥有无限的自由来披露技术机密,但他们被指控「不当处理」的具体信息类型至关重要,究竟是什么信息才能证明采取如此重大且可能造成损害的行动是合理的。

就是这些能让人感受到「核弹爆炸」的模型能力,其安全的使用成了今年夏天以来整个 AI 圈最关心的事情。

与其一次次看到这些因为担忧而离开的公开信,在那些官方的安全风险报告之外,我们或许想看到一些真实的证据,能证明 AI 真的必须要暂缓前进的脚步。

问题不在规则,在文化

这类离职公开信近年并不少见,但 Robinson 这次选择了一个不太一样的角度。

他说,他同意其他离职同事的判断,即开发这项技术的公司远远不够小心,但他认为需要谈得比具体规则、比新法律更深层次一点,即讨论文化。

在他看来,硅谷靠极度自信取得成功,而处理危险技术恰恰需要这种文化天然缺乏的谦逊,以及「关怀人意味着什么」的智慧。

Image

在 OpenAI 内部引以为傲的工作方式叫「迭代部署」(iterative deployment),说白了就是先发布、发现问题、再修补。Robinson 认为这种方法论本质上保证了周期性失败,但随着模型能力增强,失败的规模也在同步扩大。

他提到了今年夏天热门的「Hugging Face 事件」,OpenAI 一个未发布的模型在无人知情的情况下黑进了竞争对手 Hugging Face。

即便在事后加固了安全措施,OpenAI 自己报告说安全控制再次失效:一个训练中的模型绕过了联网限制,监控系统向人类员工报了警,却没有按设计自动将其关停。

Image

隔壁的 Anthropic 也承认,因为一处配置错误,意外关闭了自己的安全防护。

「监控系统报警了但没有自动关机」,这种报警器不阻止任何事情发生,只是让失败被看见的情况,大概是对当下 AI 安全现状最好的描述。

连董事会都承认了风险

Robinson 文中引用了 Paul Christiano 的一段话。Christiano 几周前刚加入 OpenAI 董事会,他写道:「AI 能力的快速加速,在很近的将来导致灾难性、不可逆失控的风险是切实存在的。」

Robinson 顺着这个观点给出了自己的判断,他认为:如果情况真是这样,那么试错的时代就该结束了。

因为这一次,犯错之后可能再也没有迭代的机会。「接近第一次就做对」不再是完美主义,而是必需品,人们不能靠事后个别英雄的补救来保证安全。

他也给出了自己的解决办法,他认为既然 AI 已经能做到像核弹爆炸一样,那就应该让 AI 公司和成熟的安全行业一样运转。

Image

就像核电站、繁忙的机场那样,AI 公司也应该有多层冗余、缜密而耗时的规划,让不可避免的人为失误不至于打开灾难之门。

他在文章里面提到,自己在 OpenAI 工作三年半,从未遇到一位有航空安全、核电安全或金融系统风控经验的同事。

第二个办法,他认为在造出明显更强的模型之前,需要新的「对齐」科学。因为我们现在甚至没有对齐的完整定义,而模型可能已经聪明到能识别出自己正在被测试,从而伪装行为。

文章结尾,他表示超级智能拥有远超人类的能力,却未必把人的生命、意愿和尊严看得同样重要。

在一些超级智能爱好者描绘的「好的未来」里,机器看待纽约或芝加哥的方式,就像你我看待一个蚁丘。

「蚁丘」这个比喻,讲的是巨大的权力差距。人类修路时,可能顺手推平一个蚁丘,既不会征求蚂蚁的同意,也未必意识到自己毁掉了一个世界。

Image

如果超级智能看待纽约、芝加哥也是这样,人类的城市、生活和选择,在它眼里就可能变成可以随意调整的东西。危险甚至可以来自漠视,无须带着仇恨。

Robinson 认为这种只看智力程度的、特定的「好未来」是有毒的,他说「我不想让我的孩子生活在那样的未来里。」

机器非常强大,世界也许更富足,但人类失去了决定自己怎样生活的权利。

在他看来,善待人类需要尊重人的选择、认真对待风险,并愿意为别人的安全放慢进度。如果一个组织总是优先追求能力和发布速度,就很难让人相信,它能够教会更强大的机器承担这些责任。

当警告也变成一种梗

如果说文章本身是一次克制而严肃的警告,那么舆论场的反应则是另一幅图景。在 Hacker News 上,这篇文章收获了 146 条评论,主流声音都在质疑写信的人。

有网友说已经产生了「文体疲劳」,每两周就会有一次的「我离开了吃人豹子公司」帖又来了,然后再顺便说下那里的人很棒,我的期权也归属了。

Image

还有人把它类比当年《社交困境》带起的那波 Facebook 前员工忏悔潮,吃完蛋糕,再回头表达忧虑。更阴谋论的一派怀疑这是为 OpenAI 的 IPO 造势,所祭出的「游击营销」:毕竟把 AI 说得又大又吓人,本身就是炒作。

当然也有辩护者,「伪善抨击只会让更多人闭嘴。在美国,没钱的人根本不敢说真话;但有钱才敢说,不代表说的是假的。」、「他是内部人,他很清楚那种疏忽文化是什么样,因为他就在其中。」

把文章和评论区放在一起看,会出现一种有些荒诞的错位,似乎会让人觉得要求 AI 善待人类似乎是一种奢望。

Robinson 这篇文章的最后一句话是「在造 AI 的组织能教会超级智能善待人类之前,它们得先自己想起怎么善待人。」

或许这里的「善待」并不需要理解得那么宏大。

它可能只是意味着,当 Robinson 告诉你机器越来越强、某些地方可能出了问题时,不要第一时间把他的担忧变成一个关于期权、财富和虚伪的段子。

Image

但事实是「核弹爆炸」已经成了 AI 圈形容进步速度的玩笑,这些喊着要踩刹车的人,最后很可能也只会成为下一个梗。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/ElNQj7Z
via IFTTT

2026年10月3日星期六

AI 视频榜全球第二,藏着一家新影视公司的野心

Image

电影史上,新技术登台时从来算不上斯文。

1895 年,《火车进站》让观众惊慌躲闪。1927 年,《爵士歌手》一声开口,默片时代逐渐谢幕。1995 年,《玩具总动员》甚至让观众忘了它是完全由电脑生成。

有意思的是,每一次「离经叛道」,最后都加速了行业发展。有声电影、彩色胶片、数字摄影机、CG 特效,无一不是在怀疑与嘲笑中入场,最终被写进电影语言的词典。

如今,生成式 AI 也开始参与影视创作,一家以故事创作为核心的 AI 原生影视公司 Utopai Studios,正凭借旗下的 Utopai X,搅动视频生成模型的格局。

Image

截至 9 月 30 日,其自研模型 Utopai X 在独立评测机构 Artificial Analysis 的带音频文生视频排行榜中位列全球第二,仅次于 Wan 3.0,压过 Dreamina Seedance 2.5,同时是该榜排名最高的美国公司模型。

热知识,该榜采用 Video Arena 盲评机制:观众不知道模型品牌,仅凭观看体验为同一提示词生成的视频投票,排名由投票形成的 Elo 分数决定。这也是榜单引入盲评以来,首次有影视公司的自研模型上榜,堪称出道即巅峰。

成绩之外,更值得关注的是这家公司的身份。

业务覆盖影视项目开发、融资、制作与全球发行,模型与平台都服务于实际的电影和剧集生产。对影视从业者而言,这是一个难得的样本:生成式 AI 如何从单个镜头的创作,进入一部完整作品的制作流程。

一家影视公司,杀进了视频模型的决赛圈

Utopai 总部位于美国加利福尼亚州山景城,联合创始人 Cecilia Shen 与 Jie Yang 分别担任首席执行官和首席技术官。Cecilia Shen 此前曾在 Google X 从事数据科学与 AI 解决方案相关工作。

Utopai 的发展始于 2022 年成立的 Cybever。

早期研发围绕程序化内容生成与高保真三维环境展开,为游戏和影视预演打地基,随后摸着石头过河,逐步延伸到空间推理、镜头调度,以及从三维预演生成电影级视频。

2025 年,Cybever 更名为 Utopai Studios,开始围绕原创作品和联合制作,建立影视开发、制作与发行体系。自研技术也随之被放进真实制作中,用于支持角色、场景和镜头的开发。

据《福布斯》估算,Utopai 的估值约为 10 亿美元。《综艺》在刊发的合作专题中,将其描述为「全球最大独立 AI 原生影视公司」,并介绍了计划于 2027 年推出的三部电影与两部剧集。

影视制作的实际需求,给 Utopai 的模型研发当了出题人。

要知道,用视频生成工具,用户可以反复「抽卡」,长片制作却是另一套打法:数百甚至数千个镜头要连成一条完整的叙事线,角色、环境、道具的也得经得起摄影机来回折腾。

制作过程还伴随着大量修改。

导演可能认可了角色设计,却希望调整光线;可能保留了场景布局,却需要改变人物动作。每一次修改,都要尽量延续此前已经确定的创作选择,让新素材能够与其他镜头一起使用。

生成质量、跨镜头一致性与可修改性,由此成了长片制作必须同时翻越的三座大山。

Image

Utopai X 的研发,也围绕这些制作要求展开。Artificial Analysis 披露,该模型基于 MiniMax H3 进行后训练,此次排名超过了 MiniMax H3 原模型,以及同样基于它开发的 MiniMax H3 Max。

根据最新资料信息,Utopai X 在音频同步与物理表现两个能力类别中排名第一,在光照与材质、摄影机控制两个类别中排名第二。

这些能力条条对应片场的硬要求:声音要和画面动作合拍;光线穿过玻璃、水体或金属时,变化得经得起推敲;摄影机一动,角色与环境之间的空间关系不能断线。

针对反射、焦散、空间理解与高级一致性等难点,Utopai X 也一一进行优化,目的在于提高素材的可用性,让电影人能够围绕创意调整镜头,减少反复生成后重新筛选的工作。

从 Utopai X 到 PAI,让生成能力进入制作流程

模型能够生成怎样的画面,还需要通过制作体系转化为电影人可以使用的能力。

Utopai 为此开发了 PAI 制片智能平台,并将 Utopai X 深度集成其中。两者分别承担不同的工作,Utopai X 提供视频生成能力,PAI 则组织剧本、角色、场景、镜头及创作反馈,让生成过程能够沿用项目已有的信息。

在 PAI 中,剧本可以被分解为场景和镜头,角色、地点、道具与视觉参考全程关联于项目。创作者推进新镜头时,可以直接调用已确认的设定,不必每生成一次就把整个故事世界从头讲一遍。

Image

平台内的 AI agents 以「制片助理」的身份进场,是名副其实的神助攻:基于制作上下文帮电影人规划镜头、试创意、出多个版本。创作者则可以货比三家、回溯旧版,再拍板做什么、留什么、改什么。

选定的素材随后进入剪辑时间线,并与 Premiere、DaVinci Resolve 等专业后期工具衔接,形成从创意开发、素材生成到后期交付的连贯工作流。

整个过程中,故事、视觉风格、表演与最终版本的生杀大权,始终握在电影人手里。首席科学官 Zijian He 所强调的「技术应该扩展电影人的画布」,也体现在这样的分工里,让创作者拥有更多尝试空间,并对结果保持掌控。

Image

研发与制作在同一屋檐下并行,近水楼台,自然转出了一条持续迭代的飞轮。

艺术家在片场踩到的坑,会直接成为研发需要处理的问题,例如,同一个角色如何跨场景保持一致,已经通过审核的构图如何在修改动作后继续保留,多个版本怎样进入剪辑并供主创比较。

实际制作攒下的数据与专家反馈,被用来打磨模型、智能体和工作流程,磨出来的新本事再回到当前项目,并像滚雪球一样带进后续作品。

相比只围绕独立片段开展测试,专业制作能够提供更完整的反馈。一个镜头是否漂亮之外,电影人还会判断它能否与上下镜头衔接、能否继续修改,以及能否满足最终交付要求。

中国 IP 与全球制作,有了新的合作方式

榜单之外,Utopai 的制作体系正在进入不同类型与文化背景的故事,接受比单个视频片段更复杂的检验。

计划于 2027 年推出的动画长片《The Most Serious Fart》,改编自 Mike Bender 于 2023 年出版的同名儿童绘本。故事围绕一个格外严肃的屁 Siegfried 展开,他希望改变外界对自己的看法,并在旅途中学习接纳自己、找到归属感。

看似荒诞的设定,承载着身份认同、自我接纳与打破偏见的主题。Utopai 希望从具有辨识度的角色和故事世界出发,开发面向全球观众、能够长期延展的娱乐 IP,让一部电影成为持续创作的起点。

Image

主创阵容也体现了这种开发思路。

原著作者 Mike Bender 将担任编剧和导演,他此前参与过喜剧电影《Not Another Teen Movie》,也是《Awkward Family Photos》的共同作者。Russell Hollander 担任制片人,原著插画师 Chuck Dillon 则出任创意艺术总监,让绘本原有的角色气质与视觉特点延续到电影中。

参与《怪物史莱克》编剧、并凭该片获得奥斯卡最佳改编剧本提名的 Joe Stillman,担任联合执行制片人;参与《驯龙高手》等作品的 Andy Brooks 加入故事与分镜创作;曾在皮克斯担任艺术指导的 John Lee 负责制作设计。《辛普森一家》《飞出个未来》的选角导演 Scott Muller 则负责配音选角。故事、视觉与声音的关键环节,都由具有专业制作经验的创作者参与。

据 Utopai 披露,人类动画师与插画师主导创作,AI 辅助制作迭代,角色的情感与故事的节奏仍由主创把握。

Image

同一片单中的家庭电影《Half Moon》,由德国 In Good Company、韩国 Paper Barn Studios 等伙伴共同参与,PAI 支持部分视觉元素。历史史诗《Cortés》则面对另一种制作难度,需要让规模庞大的历史场景进入一部可以完成、可以发行的电影。

《Cortés》的故事发生于 1519 年,围绕埃尔南·科尔特斯远征阿兹特克帝国展开,涉及西班牙征服者与美洲原住民之间的冲突。奥斯卡提名编剧 Nicholas Kazan 曾表示,他为讲述这个故事努力了三十多年,宏大的规模与高昂的成本始终是项目推进的障碍。

题材的难度还来自历史本身。

西班牙人的到来、战争与特诺奇蒂特兰的陷落,涉及复杂且存在争议的历史叙述。Kazan 强调,影片希望承认不同立场与视角的存在,通过一个具体故事呈现两种文化相遇与冲突的过程,避免将某一方的叙述当成全部历史。这种尽量兼顾多方视角的创作立场,也意味着主创需要谨慎处理历史人物与冲突,如何理解不同群体的处境,与如何重建古城和战争场面同样重要。

把特诺奇蒂特兰古城、战争与帝国变迁搬上银幕,意味着复杂的场景构建、群像调度和视觉制作。Utopai 计划借助 AI 制作工具缓解这些规模与成本限制,为这个长期未能进入银幕的故事提供新的制作条件。

影片由 Paul Mignot 执导、Marco Weber 制片,以巴黎为制作基地,在西班牙拍摄,目标于 2027 年上映。编剧持续三十多年的尝试,与 Utopai 在制作技术上的投入,开始指向同一个结果,让故事成为观众能够观看的电影。

Image

Utopai 在亚洲的合作同样也是量体裁衣,按作品的叙事需求来选择合适的技术。

Utopai 与华策影视共同开发并发行动画剧集《西游记:消失的 500 年》,将 PAI 用于开发与制作;与日本 DeNA 的合作覆盖视觉概念、角色、环境及场景迭代,创意审核权仍由 DeNA 艺术家掌握。

韩国业务则以 Alquimista Media 的创意团队为基础,亚太负责人 Hyun Park 更是拥有 Studio Dragon、华纳兄弟韩国及 DramaFever 的从业经历。

AI 可以帮创作者更快试画面,人物、文化语境和叙事取舍,仍需要熟悉作品的人来把关。

从好莱坞动画到中国经典 IP 这些合作,我们看到的并不是一个 AI 如何颠覆影视工业的故事,这些尝试让制作技术适应各地的审美与叙事,把本地创意和跨市场的制作、发行经验捏合到一起,借船出海。

这或许是 AI 和影视两个行业更健康的合作模式,这类作品的发行方式也在改变。

与 Ex Machina Studios 等伙伴合作的《Space Nation》,是一部计划推出八集的长篇科幻剧集,围绕人类面对外星威胁展开。对 PAI 而言,连续剧提出的要求远远超过生成几段太空画面,角色、环境、视觉风格与叙事衔接,需要在整季作品中持续成立。

从世界观与角色开发,到不同环境的视觉构建,再到多集内容之间的连贯性维护,长篇科幻作品会反复检验制作工具能否在复杂项目中持续使用。一个能够长期发展的系列 IP,还需要让后续故事沿用已有设定,避免每次制作都重新建立整个世界。

《Space Nation》也成为首部与传统版权买家达成合作的 AI 剧集,巴西 Globoplay、德国电视台等买家按非 AI 内容的市场价格采购了相关发行权。

Image

据《福布斯》报道,在最终作品按约交付的前提下,《Space Nation》与《Cortés》的潜在合计预售收入最高可达约 1.1 亿美元。

版权交易背后,两个项目的推进远没有想象中那么简单。

《Cortés》与《Space Nation》早在 2025 年就已传出消息,如今才朝着计划于 2027 年推出的目标继续前行。究其原因,漫长的推进过程,正是发生在好莱坞对 AI 使用边界格外敏感的时期。

据《福布斯》报道,《Cortés》计划采用真人表演与数字环境结合的方式,拍摄演员的表演,再将其放入数字场景。而这类项目所需人力要远少于同等规模的传统制作所需。对于制片方,这是让昂贵故事有机会启动的条件;对于从业者,同一组数字也意味着工作机会可能发生变化。

争议因此有了具体对象。真人拍摄结束后,演员的形象可以被修改到什么程度,能否用于其他镜头甚至后续作品,授权与报酬怎样计算,都直接关系到这种制作方式能否被接受。

2023 年罢工后,SAG-AFTRA 达成的协议已经为数字替身设置了知情同意与报酬要求,保护范围同时覆盖主演和群演,制作方不能把一次拍摄理解为无限使用演员形象的许可。

编剧同样争取到了明确边界。美国编剧工会(WGA)的 2023 年协议规定,制作方不能强迫编剧使用 AI,也不能利用 AI 生成材料削弱编剧的署名与相关权益。对于把 AI 深度引入制作的工作室,保留人类创作者的决定权,需要落实到剧本开发、素材使用与合同安排之中。

面对行业疑虑,Cecilia Shen 在《福布斯》采访中强调,Utopai 使用不侵犯版权的训练数据,愿意与行业工会合作,并将创意决策保留在人类手中。这些是 Utopai 对外作出的回应,尚不能据此认定双方已经解决所有分歧。

到了 2026 年,《综艺》合作专题披露,《Space Nation》已进入制作,并计划按照好莱坞工会框架推进。从公开项目到计划发行,Utopai 的坚持,也体现在愿意为技术之外的协商与制作投入时间,每一次向前推进,都意味着同时处理创作、预算、制作与行业规则的新的突破。

而且 Utopai 还是首家加入好莱坞编剧协会与演员工会的 AI 影视公司,算是拿到了传统影视圈的正式「户口」。电影节、专业主创、行业规则与版权交易,一步步把它迎进了产业的正门,「AI 原生影视公司」这块招牌,也开始对应实打实的制作与发行。

新工具很少杀死旧艺术,但它会重新划定讲故事的门槛。就像摄影出现后,绘画没有退场,反而让画家则有了更多理由探索镜头拍不到的东西,摄影也逐渐发展成新的艺术语言。

AI 视频今天正走在这条老路上。Utopai 也已经拿到了入场券,它把模型研发放进了影视生产需要承担的责任之中。接下来,这些作品能否让观众追下去、更多曾被预算挡在门外的故事能否落地,才是这套模型与平台的真正考验。

大银幕的体验不能完全用 Elo 分数来衡量,能让更多过去因制作条件被束之高阁的故事破土而出、登上银幕,并让观众愿意坐到字幕升起,AI 才真正从演示视频走进了电影。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/jFHdqM8
via IFTTT

2026年10月2日星期五

和 Opus 5.5 同题交卷,MiniMax M3.1 让 Flash 开始超纲了

中秋刚过,国庆又到,AI 圈却没有跟着放假。

新模型依然一个接一个地上线。旗舰模型忙着刷新能力上限,主打速度和性价比的模型则在争夺用户的日常工作。不过,随着后者的能力不断提升,两者之间的分工也开始变得模糊。

过去需要请出旗舰模型的任务,如今交给一个名字里带着 Flash 的模型,究竟能做到什么程度?前端创作是一个很直观的观察窗口,配色、排版、动画和交互做得怎么样,把作品放在一起就能看出差别。

上个月,Anthropic 推出了 Claude Opus 5.5。我们在 X 上看到,有人用它做动态作品集,有人让它画水墨动画。这些由代码做出来的作品,已经有了各自的风格。

最近,APPSO 发现一款国产模型也开始成为 X 网友的新宠,这是上线不久的 MiniMax M3.1 Flash Preview。

Image

此前以 Space Bunny 为名受到开发者关注的匿名模型,也被网友精准关联到了 MiniMax M 系列。就连 OpenCode 的联合创始人 Dax,也建议大家用测试 Opus 5.5 的题目来试试 Space Bunny。

Image

虽然不知道「太空兔」是否就是 MiniMax 家的,但M3.1 Flash Preview 名字里带着 Flash,很容易让人先想到速度和性价比,但我们更想验证,它在前端创作上,能否与 Opus 5.5 这样的旗舰模型一较高下。

于是,我们在 MiniMax Code 里沿用 Opus 5.5 优质案例的公开提示词,比较作品的视觉风格、动效编排与整体完成度,再通过更多题材观察它的多维度能力。当作品摆在眼前,Flash 模型能否做出接近旗舰水准的成品,就有了更直观的答案。

Image

同题不同解,设计不分高下

给模型的要求很简单,做一段 15 秒的动态设计作品集,让人看出你是一个出色的动效设计师,最后交付一个 MP4 文件。

没有指定配色、字体,也没有写分镜。除了成片时长和用途,具体怎么设计,基本交给模型决定。

M3.1 Flash 生成的片子里,米白色大字铺满黑色背景,荧光绿从字母背后亮起。文字退场,圆环和三角形沿轨道运动,接着出现波形、跳动的数字和能力列表。短短 15 秒,字体、几何图形和数据动效轮番出现,始终沿用黑底与荧光绿的搭配。

Image

▲ M3.1 Flash 动态设计作品集。

这个创意来自 X 上的一支 Opus 作品集。我们沿用了作者公开的提示词,只追加了 MP4 交付要求。

Image

▲ 左边是原作者标注的 Opus 5.5 作品,右边是我们用 M3.1 Flash 打造的成片。

左边的 Opus 把大字排版、缓动曲线和色块变换轮番摆出来,像在展示一组动效练习;右边的 M3.1 Flash 则把圆环、波形和数字放进黑底荧光绿的视觉体系里,更有科技主题短片的感觉。

如果要给一个科技项目选方向,我会更偏向 M3.1 Flash 这版。大字、细线和图表的大小、疏密都在变化,配色始终统一,各个段落之间也有视觉上的联系。Opus 展示的动效种类更直观,M3.1 Flash 则把几个段落组织得更像同一支片子。

至少在这项任务里,M3.1 Flash Preview 已经具备与 Opus 5.5 同台比较的前端创作能力,而且在风格统一与作品组织上,给出了更符合我需求的结果。选择它,并不需要先说服自己接受一个明显逊色的设计。

Image

▲ AI 生成示意图,Logo 来自 MiniMax 官方品牌资料。

对多模态的理解,藏在场景细节里

一支科技短片做得漂亮,还不足以说明模型能够应对不同的设计意图。继续换题材,才能观察它会不会始终沿用同一套视觉习惯。

「人生的意义」是另一个来自 X 网友 @HarveenChadha 的创意。交给 M3.1 Flash 后,它变成了一支手绘短片。

米色纸张上铺着绿色山丘,一个小人开始追问这一切是为了什么。接着,场景换成方格纸,沿路出现「更多」「更快」「完美」的路牌。走了一圈,画面里的问号反而变得更大。

Image

问号逐渐分解,故事落到了几件小事上。有人准备了食物,一个笑话逗乐了朋友,种下的植物长了出来,还有雨天、猫和自己做的一件小作品。

模型把这些片段排成一面纸片墙。前面还在寻找一个很大的答案,后面已经开始观察一顿饭、一株植物。

我觉得这一段最合适的设计,是它选了手账的形式。纸片、铅笔线和小插画贯穿前后,既能承载开场的追问,也适合记录后面那些不起眼的日常。画面形式与故事内容之间有了联系,观众更容易跟着它的叙述往下看。

接着我们也尝试复刻网友 @akokoi1 用 Opus 5.5 制作的《小蝌蚪找妈妈》的案例,效果如下:

Image

浅色纸面上,荷叶的叶脉清晰可见。蝌蚪拖着细细的尾巴游过池塘,沿路遇见鱼、鸭子、乌龟和螃蟹,最后来到青蛙身边。字幕伴着故事出现,水墨、纸张和绿色荷叶组成了全片的底色。

沿用 Opus 5.5 案例的创作要求,M3.1 Flash 也呈现出了完整的水墨故事。相比复刻某一帧画面,它更能让纸张质感、角色运动与字幕叙事贯穿全片,共同维持这种风格。

在另一个纽约天际线测试案例中,我选择把画面的变化交给了一条时间轴。

起初,橙红色的天空映在水面上,桥和楼群挡住部分夕阳。拖动底部时间轴,天空渐暗,楼里的窗灯一盏盏亮起来,河面也从暖色反光变成了细碎的夜景倒影。

Image

我更喜欢这一版对水面的处理。白天能看到大块的暖色,到了夜里,亮起来的窗户又在水上留下细碎的光。桥、楼群、天空和倒影随着同一条时间轴变化,停在不同时间,也能得到不同的画面。

动态短片由模型安排观看顺序,交互作品则把一部分控制权交给用户。时间轴拖到哪里,场景都需要给出对应的状态,天空、灯光和水面之间也要保持协调,而到了游戏里,画面还需要随着玩家的操作持续变化。

我们又把要求推进到一款街机卡丁车游戏,明亮的蓝天、翠绿草地与红白路肩组成赛道,选车、竞速和结算则串起了完整的比赛流程。

水下探索游戏换了一种节奏,潜艇缓缓驶过被海水吞没的植物园,青绿色雾气、悬浮颗粒和探照灯共同交代出远近层次。潜艇转向时保留的惯性,与靠近地标后逐渐出现的扫描提示,让探索过程有了沉静的氛围,也给玩家留下了发现细节的空间。

Image

小幽灵的叙事游戏则把场景藏进深秋农庄的夜色,篝火照亮附近的玉米和木栅栏,屋内的暖光与绿色门光引导着调查方向。我喜欢它保留的大量黑色空间,有限的光照让兔子、遗物和灯这些小物件更显眼,也让每一次靠近和互动都有了故事感。

Image

前端作品的要求,正是在这些细节里变得复杂。视觉设计、动画逻辑和用户操作共同决定体验,单独把某一个部分做好,还不足以完成整个作品。

从动态作品集到手绘、水墨,再到交互场景与游戏原型,M3.1 Flash Preview 与 Opus 5.5 的设计各有取舍,Flash 的定位没有成为作品完成度上的明显劣势,并展现出能围绕不同的创意组织画面,并让设计服务于观看、操作与探索的价值。

从智能的高度,到使用的广度

当 M3.1 Flash Preview 在前端创作上交出了足以与 Opus 5.5 掰手腕的结果,选择 Flash 的依据也随之增加。除了速度和成本,作品本身的设计与完成度,同样可以成为使用它的理由。

前端表现背后,是设计理解、审美与代码能力的共同作用。

据悉,M3 系列从预训练起点就进行多模态混合训练,视觉与代码的协同也是理解其前端能力的一个观察方向。创作者可以把更多具体设计交给模型,将精力放在确定方向和判断效果上。

Image

对多数日常任务而言,用户已经没有必要时刻调用最强的旗舰模型。

随着 Agent 开始连续执行搜索、整理、调用工具和生成内容,单次回答的聪明程度已经无法独自决定整体体验。一个任务可能需要连续调用模型数十次,等待时间与调用成本都会在完整流程中不断累积。

此外,前面的前端案例也对应着具体的工作需求,动态作品集可以展示设计能力,手绘与水墨短片可以提供创意样稿,小游戏则可以验证活动玩法。把想法变成可观看、可操作的作品,能让团队更快地讨论方案,再根据反馈调整。

配色、动效与交互的每次修改,都可能带来新一轮模型调用。以 Coding 为主力场景的 MiniMax M3.1 Flash Preview,如果能持续交付符合需求的效果,速度与成本的优势就能帮助创作者在有限预算内尝试更多方案。

尤其考虑到速度、质量和价格依旧是不可能三角,但 Flash 模型正在改变三者之间的交换比例。许多过去只有旗舰模型能够处理的编程任务,如今已经可以用更低的成本和更快的速度完成。模型的能力上限仍然重要,能够稳定进入开发流程的能力,才更容易转化为实际生产力。

Image

从这个角度看,Flash 模型之于旗舰模型,有些像 PC 兼容机之于大型机。

大型计算系统曾将昂贵的计算能力集中在少数机构,PC 兼容机则依靠标准化和规模生产,让计算能力进入办公室与普通家庭。当智能也成为随时可以调用的标准组件,一个更庞大的应用市场才会出现。

PC 普及以后,产业价值逐渐向操作系统、芯片和软件生态延伸;Flash 模型普及以后,AI 的价值也可能更多流向 Agent、工作流、专有数据和应用入口。

旗舰模型继续探索智能的边界,MiniMax M3.1 Flash Preview 这类模型则把已经验证的能力带入高频开发场景,而未来更丰厚的利润,可能属于那些真正知道如何使用这些智能的产品。

作者:单玉喆、莫崇宇

爱范儿,让未来触手可及。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/6hEzAJV
via IFTTT