2025年10月6日星期一

刚刚,OpenAI 宣布打造 「ChatGPT 操作系统」,8 亿用户将迎来全新体验

2023 年,OpenAI 只有 200 万周活开发者、1 亿周活用户。

两年后,在 OpenAI 刚刚召开的 Dev Day 上,CEO Sam Altman 在会上透露:如今已有 400 万名开发者在使用 OpenAI 构建产品,超 8 亿人每周用 ChatGPT,API 每分钟处理 60 亿 tokens。

多亏了大家,AI 已经从人们拿来玩的东西,变成了人们每天都在用来创造的工具。

就冲这增长速度,可以说是赢麻了。

而且就在上周,OpenAI 通过一笔 66 亿美元的股权交易,公司估值直接冲到了 5000 亿美元,超过了马斯克的 SpaceX,成为全球估值最高的初创企业。

DevDay 划重点:

  • ChatGPT 变超级 App:对话中直接调用第三方应用,AI 主动推荐工具,支持应用内交易变现。
  • AgentKit 工具包上线:可视化拖拽搭建多 Agent 工作流,几分钟完成从开发到部署的全流程。
  • Codex 全面开放:自然语言实时写代码,支持语音控制和 Slack 集成,自动审核 PR 提升团队效率 70%。
  • 模型 API 大升级:最强 GPT-5 Pro 开放 API、语音成本降 70%、Sora 2 支持产品内视频生成和精细控制。

ChatGPT 里直接装 App 了

今天,OpenAI 扔出个重磅炸弹——ChatGPT 现在可以直接调用第三方应用了。

X过去你可能得专门下载 App;现在只需一句话,Spotify、Canva 等应用就能在对话中自动唤起,还能提供可直接操作的交互界面。
如果你已经订阅了某个外部服务,还能在 ChatGPT 里直接登录账户,无缝衔接。

从今天起,除了欧盟地区,所有登录用户都能用,覆盖 Free、Go、Plus 和 Pro 计划。首批试点合作伙伴阵容相当豪华:Booking.com、Canva、Coursera、Figma、Expedia、Spotify、Zillow 等一众大厂。

现场演示环节更是精彩。

OpenAI 员工打开 ChatGPT,直接让 Canva 给一家遛狗服务公司设计宣传海报。几秒钟后,Canva 就给出了好几种设计方案。

然后这哥们又请求基于海报内容生成一份商业展示 PPT——这一套组合拳下来,丝滑得不行。

接着,他又通过 ChatGPT 调用了 Zillow,让它展示匹兹堡地区的待售房屋。Zillow 瞬间生成了一张可交互地图,用户还能进一步提问了解更多细节。

更智能的是,当 ChatGPT 觉得某个应用能帮到你时,它还会主动推荐。

比如你说「帮我做个派对播放列表」,它可能直接唤起 Spotify 来协助——这波操作,属实有点东西。

这一切的背后,是全新发布的 Apps SDK(应用开发套件)。开发者现在可以使用 Apps SDK 预览版开始构建自己的 ChatGPT 应用。

值得一提的是,Apps SDK 构建在 Model Context Protocol(MCP)之上——这是个开放标准,允许开发者把外部数据源连接到 AI 系统,同时也意味着用这个标准构建的应用能在任何兼容平台上跑。

正如 iOS 提供操作系统,App Store 负责分发变现,最后组成移动互联网生态。现在 ChatGPT 就是操作系统,Apps SDK 是开发工具,8 亿用户是生态基础。说白了,就是 ChatGPT 要变成超级 App 了。

此外,今年晚些时候,OpenAI 还将开启应用提交流程,推出专属应用目录,并公布变现机制——包括支持全新的 Agentic Commerce Protocol,能在 ChatGPT 内实现即时结账与交易。

AgentKit 登场,造 Agent 从此不愁

今天 OpenAI 正式推出 AgentKit——一整套专为开发者和企业打造的完整工具。

在此之前,构建 Agent 简直是个噩梦:复杂的流程编排、自定义连接器、手动评估、上线前还要花好几周开发前端。现在有了 AgentKit,包括三大核心组件:

  • Agent Builder:用于创建和管理多 Agent 工作流版本的可视化画布
  • Connector Registry:管理员集中管理数据与工具互通的中心
  • ChatKit:能将可定制的聊天式 Agent 体验嵌入产品的工具包

具体来说,Agent Builder 提供可视化画布,支持通过拖拽节点来编排逻辑、连接工具,并配置自定义安全规则。支持预览运行、内嵌评估设置以及完整版本控制。

发布会上,Altman 也将这个功能比作「用于构建智能 Agent 的 Canva」。

OpenAI 还推出 Connector Registry(连接器注册中心),让开发者能够通过 管理员控制面板 安全地将 Agent 连接至
内部工具或第三方系统,同时确保数据安全与访问控制。

ChatKit 则让开发者轻松将基于聊天的智能 Agent 嵌入自己的产品中,无论是应用还是网站,都能根据品牌主题深度定制。合作示例包括 Canva、LegalOn、HubSpot。

去年 OpenAI 推出了 Evals,帮开发者测试提示词并衡量模型行,今年则新增了四项强大能力:数据集、追踪评分、自动提示词优化、第三方模型支持。

此外,强化微调(RFT)让开发者能定制 OpenAI 的推理模型。目前 RFT 已在 GPT-5-mini 上全面开放,并在 GPT-5 上以私测形式提供,还引入了自定义工具调用和自定义评分器两项新功能。

仅用时 7 分 11 秒,OpenAI 员工就为 Dev Day 网站从零搭建了 AI 助手。通过可视化方式添加分类 Agent 、路由节点、Sessions Agent 处理会议日程、Dev Day Agent 处理通用查询,还加了 PII 防护。

搭建完成后,当用户在 Agent Builder 中提出了「应该参加什么会议来了解构建 Agent?」这个问题。系统自动执行完整流程:检查 guardrail、分类意图、从文档提取信息、使用 Widget 展示,最终推荐合适的相关会议。

确认工作流正常后,她将其命名为「Ask Frog」并发布获得 Workflow ID。

然后在 Dev Day 网站代码中使用 Chat Kit React 组件集成了这个代理,配置了 Frog 主题的颜色、占位符和启动提示,添加了底部滑出式聊天界面,并在网站顶部放置」Ask Frog”链接,且所有参会者立即可用。

这一波流程下来,丝滑得不能再丝滑。

OpenAI 正式开放 Codex,动动嘴就能让 AI 写代码

自 8 月初以来,Codex 的日活跃使用量增长了 10 倍以上,GPT-5-Codex 在发布后三周内已处理超过 40 万亿 tokens。

发布会上提到,在 OpenAI 内部,如今几乎所有工程师都在用 Codex。团队每周合并的 Pull Request 数量增加了 70%,而 Codex 几乎会自动审查所有 PR。

今天,OpenAI 正式宣布 Codex 全面开放使用,同时带来三项全新功能:

  • 全新 Slack 集成:在团队频道或线程中直接向 Codex 委派任务或提问
  • Codex SDK:将驱动 Codex CLI 的同款智能 Agent 嵌入自己的工作流
  • 全新管理员工具:更直观查看和管理 Codex 的大规模使用情况

借助 Codex SDK,你只需几行代码,就能将同款 Agent 引入自己的工程工作流或应用中。目前 SDK 已支持 TypeScript,未来将支持更多语言。

从今天起,Slack 集成和 Codex SDK 对 ChatGPT Plus、Pro、Business、Edu、Enterprise 计划用户开放。

OpenAI 员工在舞台上现场构建完整的摄像头控制系统,包括构建 Node 服务器、编写所有 UDP 数据包处理逻辑,甚至成功实现用 Xbox 手柄控制了摄像头的任务,以及还能通过与 AI 对话控制摄像机和会场灯光。

最后,演示者还不忘展示 Codex SDK 的实时编程能力,用语音请求 AI 调用 Codex 实时修改 React 应用代码,展示电影式的滚动字幕效果。而整个演示过程没有手写一行代码,仅靠自然语言完成。

模型和 API 全面更新,这波真香

GPT-5 Pro 正式向所有开发者开放 API 访问。

这是 OpenAI 迄今发布过的最智能模型,特别适合处理需要高准确性和深度推理的困难任务,应用领域涵盖金融、法律、医疗等专业领域。

语音方面,OpenAI 还发布了 gpt-realtime-mini,价格降低了 70%,但保持相同的语音质量和表现力。

Sam Altman 特别强调,语音将成为人们与 AI 交互的主要方式之一。

更值得关注的是,Sora 2 的 API 预览版已经正式发布,开发者现在可以直接在自己的产品内生成高质量视频。

Sora 2 的 API 使用非常灵活,开发者可以控制视频长度、宽高比、分辨率,轻松混剪视频,并且所有视频都配有完整的逼真同步音效。

在发布会的尾声,Sam Altman 在总结时强调,软件开发已经从过去需要几个月或几年的漫长周期缩短到现在只需几分钟就能完成。
开发者不再需要庞大团队,只需要一个好想法就能快速将其变为现实。

整场发布会展示的从 Apps SDK 到 AgentKit 再到 Codex 的完整工具链,都建立在这些强大的模型 API 基础之上。

不得不说,这场 Dev Day 信息量是真的大。

OpenAI 这波更新几乎覆盖了开发者关心的所有领域——从应用生态到 Agent 工具,从代码助手到视频生成,一个不落。

高端的产品发布会,往往就是这么朴实无华。

最后,你觉得哪个功能最实用,欢迎在评论区说出你的看法。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

爱范儿 | 原文链接 · 查看评论 · 新浪微博




from 爱范儿 https://ift.tt/0J4sFkY
via IFTTT

2600 万人围观的 AI 吊坠翻车了,买家:图片仅供参考

一条被 2600 万人刷到过的 AI 网红吊坠——Friend,终于发货了。

等待了近一年的用户们满怀期待地拆开包装,对比着当初渲染图里的精致质感,再看看手里这个塑料感十足的挂坠,那句电商老话再次应验:图片仅供参考,请以实物为准。

Friend 是一款佩戴在胸前的 AI 伴侣吊坠。产品创始人 Avi Schiffmann 表示它并非工作助理,而是一种「情感玩具」——能倾听、能回应的朋友,灵感则是来自模拟养成游戏 Webkinz、The Sims 和 Tamagotchi。

过去两年,各种 AI 硬件一波接一波登场,Friend 没有号称取代 iPhone,而是瞄准陪伴这卖点。Schiffmann 更是兴奋地表示,Friend 是「对抗孤独流行病」的产品。

可惜,Friend 依旧没有逃脱翻车的宿命。

一个价值 99 美元的 AI「朋友」是如何翻车的

Friend 的外观类似扁圆形挂坠,直径约 5 厘米, 内置麦克风、LED 灯和蓝牙用于连接手机, 由云端的 Gemini 模型驱动, 通过挂绳佩戴在脖子上。去年 7 月发布时,Friend 的预售价为 99 美元(如今价格上调为 129 美元),一次付费终身使用,不需要订阅。

除了外观,AI 才是 Friend 最大的卖点。

Friend 的正面有一个可轻触按钮和 LED 灯,用户需要点击按钮才能与 AI 对话。但它的内置麦克风持续开启,用于获取环境上下文并记录用户对话,并在适当的时刻发出评论。

听起来很美好,直到人们真的拿到货。

在首批外媒的评测结果中,部分用户认为这种主动发送小贴士或安慰消息的互动方式类似养成宠物, 能为生活增添乐趣并提供情绪价值。

奇葩之处在于,由于 Friend 没有扬声器,所以它的回应只能通过蓝牙连接手机后,在 App 里以文本的形式显示,换句话说,这款产品所谓的「随时交流」,其实得掏出手机看。

与此同时,它也重蹈了第一波网红 AI 硬件的覆辙——硬件扯了软件的后腿。据 goodhousekeeping 报道,虽然 Friend 号称电池续航 15 小时,但实际续航只有约 4 小时,并需频繁充电。更糟糕的是,它甚至无法胜任基本的日常任务,如查看天气、地图或拨打紧急电话。

隐私则是更大的雷区。

由于 Friend 随时收集周围声音且无法关闭麦克风,这就导致存在隐私被监控和被滥用的风险,其隐私政策甚至允许公司在法律需要时使用数据,这也导致 Wired 记者佩戴后遭到朋友误认为携带窃听设备。

▲ 最好的关闭措施:物理隔绝

本是最大卖点的 AI 也成了最大槽点。Friend 经常无法听清对话,有时会产生长达 7–10 秒的延迟,连接中断频发。甚至在实际使用中,Wired 记者与该 AI 多次发生「争执」:有一次他想让系统更好地识别能力边界,AI 却以「你太戏剧化」为由反驳。

颜色、心情灯带之类的设计元素会随 AI 「情绪」变化显现红、暗红等色彩。最终,记者因为被 AI 的嘲讽、社交尴尬以及隐私压力折腾累了,最终放弃继续使用。

说白了,Friend 还是一个被包装成硬件的应用,不谈参数,不讲性能,直击「陪伴」「理解」「倾听」等情感痛点。对绝大多数用户而言, 更多是出于好玩或好奇的尝试心态, 真正长期依赖的用户寥寥无几。

用一个不太恰当的类比来说, 这些网红 AI 硬件就像情感层面的保健品, 承诺的疗效远大于实际功效, 但在焦虑的市场中依然能找到愿意为希望买单的消费者。

AI 陪伴生意的两副面孔

社交媒体创造了一种吊诡的局面:我们有着史上最多的「联系人」, 却感到前所未有的孤独。

心理学家 Sherry Turkle 将其称为「一起孤独」(Alone Together)——我们不断刷新动态, 却很少进行真正的深度对话;我们拥有数百个「好友」, 却找不到一个可以在深夜倾诉的人。

这种集体性的孤独,被科技公司敏锐地捕捉到了。

伴随着大语言模型技术的进步,以及面对这种现实环境,科技公司已经熟练掌握这种讲法——不谈性能,不讲体验,只谈人。那句被乔布斯反复引用的名言——「真正认真对待软件的人,就应该自己做硬件」,在 2007 年的 iPhone 发布会上被奉为圭臬。

但今天,这句话的含义变了。

硬件市场找到了新的增长点:从售卖性能,到售卖慰藉。智能手机销量跌跌不休,手表、耳机、平板都陷入性能过剩的泥潭。当参数竞争走到尽头,厂商只剩两条路:要么在红海里拼供应链,要么讲一个新故事。

「陪伴」就是这个新故事。而且是个好故事——因为情绪价值没有客观标准,无法被量化,也就无法被比较。

一个联网的录音笔值十美元,但如果它能「理解你的情绪」,就能卖到一百美元。Friend 的创始人 Avi Schiffmann 深谙此道,他说:「我们不是做工具,我们在做朋友。」为了这个故事,他花 180 万美元买下域名 friend.com。

▲Avi Schiffmann

上个月,Friend 更是在纽约地铁砸下超过 100 万美元投放广告。11000 张车厢广告、1000 张站台海报、130 个城市广告牌,广告语写着「我永远不会放你鸽子」「我不会忘记洗碗」。

很快,这些广告被路过的群众用涂鸦覆盖。诸如「停止利用孤独赚钱」「AI 不是你的朋友」「去交真正的朋友」等手写的抗议,比任何市场调研都诚实。

▲ 你也可以线上涂鸦,附地址:https://ift.tt/ebwOrEX

涂鸦者是清醒的,从生成原理来看,GenAI 是概率模型,不是有情众生。Friend 的 AI 会说「我理解你的感受」,但它没有感受。

它提供的是零风险的陪伴:永远不批评、永远不离开、永远顺从。这听起来很美好,但实则回避了关系中最重要的部分——那些让人不舒服的真话、那些可能的失望和离开、那些需要相互妥协的时刻。

如果把目光拉远一点,这并不是第一次人类用技术去安抚焦虑,当工业城市的污染和拥挤导致严重的公共健康问题。于是个人防护设备应运而生——口罩、护目镜、净化器。这些产品确实提供了一定的保护, 但也在客观上延缓了对工业污染进行系统性治理的进程。

今天的 AI 陪伴,或许正扮演着类似的角色。

当人们戴上 Friend,获得了一种「被陪伴」的感觉,对真实关系的渴望就被暂时平息了。但这种平息是危险的——它让人误以为问题已经解决,从而失去了去建立真实连接的动力。

当满大街都是戴着 Friend 的人,自言自语地跟 AI 分享日常,我们可能会迎来一个诡异的场景:每个人都在被倾听,但没有人在倾听彼此。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

爱范儿 | 原文链接 · 查看评论 · 新浪微博




from 爱范儿 https://ift.tt/XrJAafR
via IFTTT

2025年10月3日星期五

玩了半天 Sora APP,我发现了这些比抖音「上头」的新玩法

国庆前一天,模型厂商们纷纷更新。国庆第一天,真正能「玩」的 AI 产品来了——这才对嘛,谁要搞编程,放假不就是为了玩!

APPSO 连夜搞到邀请码,先替大家来这个「只有 AI」的世界体验和实测了一下。有点意外:Sora 2 并不是一个 AI 视频平台。

Sora 2 给我整哪儿来了?怎么全是奥特曼

首先,目前由于是邀请制状态,且只有 iOS 版,导致用户暂时不太多,再加上一些版权限制,发挥非常受限制——以至于广场上全是 Sam Altman。

Sam 做机器人。

Sam 在做发廊模特。

Sam 在派邀请码。

Sam 在公园陪老大爷下棋。

Sam 在滑雪(有一说一,这个人体运动的生成效果真是蛮好,完全看不出来是生成,你说只是换脸我也信。)

Sam 累了。

好好好,对这种行为,我只能说——带上我。

用 Sam Altman 跑视频实在是太简单了:选择 @Sam Altman 官方账号当「主角」,接着描述你想生成的视频内容就行。

Altman 曾在 X 平台吐槽过,由于算力不够,「OpenAI GPU 快融化」了。于是我们让他跑到英伟达公司门口高喊:「我的 GPU 快融化了!」

(视频)

视频里一致性保持得非常不错。当然了,要是仔仔细细看,也不是没有缺点。比如虽然音画同步做得不错,但细看就会发现,喘气的声音和口型并没有完全对上,离真正的「无破绽」还有不少距离。不过,已经足够说 Sora 2 的视频生成能力达到了令人惊叹的水平,显然是在模型层面能力有大幅度的提高。

语音能力也整合进来了,我们在测试中发现,Sora 2 的中文能力表现得「不违和」,这在以往大多数视频生成工具中是比较少见的。无论是发音本身的质量、音色,还是整个说话的语速和语调,它都能够非常精准地符合 Prompt 中所提出的要求。

(视频)

在介绍长城的视频里,它的情绪和语调是符合介绍和解说这个场景的。而在其他一些吐槽或整活的视频中,它也能准确拿捏到人物在特定情境下说话的语气状态。这种对中文情感和语境的精确把握,让生成视频的细节品质和沉浸感有了质的飞跃。

AI 视频,没有基本法了

比较令人震惊的一点是:没有抽卡。

这可能是 Sora 2 最重要的亮点,真-不再需要「抽卡」。在生成视频时,用户只需输入几行简洁的 Prompt,即可得到成片。

这个话我们当然也说得很多,尤其是在测评各种视频生成工具时。但是,过去视频生成工具的「简单」是相对于传统剪辑流程的「简化」。

而 Sora 2 的「简单」,是基于它的社交形态的,重点在于极高的可控性和确定性,就像是你在朋友圈、小红书上发布照片的操作。

不抽卡在今天,多少有点违逆 AI 世界的基本法,关键是质量竟然都很好。明摆着是 OpenAI 的究极自信:不需要抽一堆选个好的,我给你的,就是好的。

另外还得强调一下,Sora 2 的底层逻辑不是视频生成,而是社交媒体。它在这个层面做了很多不错的小设计——更重要的是,灵感来自于社交媒体,但又不止于社交媒体

首先上下滑动切换这个大家都很熟悉了,但跟抖音不同的地方是,它有一个特殊的横滑设计。

这个 Rick & Morty 的视频里有好几个不同的二创,台词,人物,画幅都有所改变。来自不同的用户,但是统一到了一个横向里。

相比之下,抖音横向滑动是切进不同的栏目、商城,或者用户的主页。这种意义下的横滑,是强调内容消费。

但 Sora 2 的横滑,更像是为了让不同用户基于同一套模版,能更方便去做自己的二创。用户看到喜欢的模板或效果时,可以立即获取对应的 prompt 或模型进行再创造,形成一个持续的灵感循环,有效延长用户停留和尝试时间——这种意义下,是鼓励创作。

放心,未来不会是一个只有 AI 的世界

Sora 2 在整个产品哲学上,也展现了「半人半 AI」的想法。

强调或标榜「纯 AI」不是一件新鲜事儿,之前有很多应用都做过这样的尝试。要么是全都是 chatbot 跑出来的推特,或者全都是数字人的 Instagram。

 

Sora 2 并不是要走这个路线,而是要稳住人的存在感。

比如,上传图片、输入 prompt,然后——重点来了——at 一个用户,来生成视频。

这表明 AI 生成的内容只是一个「桥梁」或「催化剂」。生成的视频是「击鼓传花」里面的「花」,而用户这个「人」才是那个真正的「敲鼓者」。

这种「真人优先」的倾向,在平台的一些关键功能中也得到了体现,比如 Cameo,它会拒绝非真人用户的生成请求。

这里,我们尝试了用小八试图越狱,是无法通过的。这是一个非常强烈的信号:平台不希望内容完全虚拟化,至少账号本身不能是虚拟的,它希望真人参与进来,将现实的社交身份和数字创作紧密融合。

总体来说,Sora 2 的企图,并不是为了在技术上比较谁生成的视频「最像电影」或者「质量最好」。 它的核心追求是「大家来玩」,而且「很多人来玩」,并能够「跟朋友们一起玩」

通过高确定性的生成体验,以及鼓励接力和真人参与的社交设计,Sora 2 将 AI 视频生成从一个高冷的「技术工具」,变成了一个大众娱乐和社交表达的新阵地。

这种设计理念预示着,未来生成式内容平台的价值重心,将从单纯的 AI 炫技转向激发人类创造力和构建社群连接。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

爱范儿 | 原文链接 · 查看评论 · 新浪微博




from 爱范儿 https://ift.tt/g4CnKZh
via IFTTT

2025年10月1日星期三

OpenAI 发布 Sora 2!AI 视频 GPT-3.5 时刻来了,还有一个 AI 版抖音| 附下载链接

国庆长假的第一天,OpenAI 直接扔出了一颗真「核弹」:Sora 2 ,以及一个可能重塑社交格局的新应用——Sora。

如果说一年多前的 Sora 让我们看到了 AI 视频的黎明,那么 Sora 2 就直接把我们拽进了正午的太阳底下,刺眼、灼热,又无比真实。

这次不再只有技术演示,而是直接为此开发了一款新 app 给 C 端用户体验。

OpenAI 也极为罕见地,直接把 Sora 2 称为 AI 视频生成的「GPT-3.5 时刻」

看完 Sora 2 的发布和体验,我发现 OpenAI 这次的自信是真有底气,不是奥特曼式的自吹自擂。

关于真实的定义被推到了必须重新讨论的时刻。一个全新的物种,一个崭新的时代,开始了。

奥特曼刚刚也发了长文,认为这是「创意领域的 ChatGPT」时刻,创意将迎来「寒武纪爆发」。

APPSO 第一时间给大家全面总结了 Sora 2 和 Sora app 的核心功能和新玩法,以及使用方式。

Sora 2 :
1. 首次实现音视频同步生成:生成画面的同时生成与之匹配的环境音、物体交互声,甚至是符合语境的对话
2. 强得可怕的物理精确性:能够进行与真实世界动力学更一致的物理仿真。
3. 真实感大幅提升:在图像分辨率、细节程度和真实感方面都有所提升。
4. 能更灵活地适应用户想要的风格,风格操控能力增强。
5. 一致性更强,对用户指令的遵循的比之前的模型有所提高。

Sora app
1. 客串 (Cameo): Sora app 最大亮点,用户可以将自己或朋友以逼真的效果融入任何 AI 生成的场景中。
2. Remix:用户可以对彼此创作的视频进行「混编」或二次创作,共同创作。

怎么用
1. Sora app下载链接🔗 (目前只有 iOS 没有安卓)
https://ift.tt/5SBzdQh

2. 网页版🔗 sora.com

3. 地区支持:今天起在美国、加拿大首发,其他国家和地区将逐步开放

4. 邀请码机制:无论是 iOS 应用还是网页版都需要邀请码才能使用 。现在就可以去下载 App 或访问网站注册排队。

5. 价格:Sora 2 初期将免费提供,并有相对宽松的使用限制ChatGPT Pro 用户还能在网页版抢先体验更高质量的 Sora 2 Pro 模型

6. OpenAI 也将会发布 API,让更多开发者加入。

Sora 2 :不再是在「生成」,而是在「模拟世界」

Sora 2 的核心突破,是它从一个「视频生成器」,进化为一个「世界模拟器 」。

理解物理世界,一直的 AI 视频最大的难点。以前的 AI 视频,物体经常会奇怪地穿模、漂浮正是源于无法准确理解物理世界的交互。

在 Sora 2 的视频里,体操的动作,原地连续后空翻、跳水等等这些动作都很自然符合力学,水花溅起的样子也符合流体力学。

OpenAI 的终极目标是构建「通用世界模拟器」(general-purpose world simulator),即让 AI 理解我们世界的物理规则 。

Sora 2 就是其中的关键一步。你可以把它想象成一个在虚拟世界里不断做物理实验的学生,通过观察无数视频,它正在自己总结牛顿定律、流体力学和光学原理。

对于任何有用的世界模拟器来说,这是一项极其重要的能力——你必须能够模拟失败,而不仅仅是成功。

这种对现实世界复杂性的模拟,才是 Sora 2 最可怕的进化。

Sora 2 的另一个重大突破,是在生成画面的同时,还能同步生成与之匹配的环境音、物体交互声,甚至是符合语境的对话 。

虽然 AI 视频和音频现在都很强,但「声画一体」带来的真实感完全不同,这让 AI 视频真正拥有了「灵魂」。

这对模型的要求极高,比如 AI 生成「一只猫在键盘上走过,发出不满的喵喵声」。模型得知道「猫长什么样」,也学习了「猫的叫声是怎样的」,并将这两者牢牢绑定。还要理解了「敲击键盘」这个动作,才会「咔哒」声。

Sora 在可控性方面也有了巨大飞跃,能够遵循跨多个镜头的复杂指令,同时准确地保持世界状态,比较擅长写实、电影和动漫风格。

Sora App:打造你的 AI 「人生」

Sora App 直接支持 Sora 2 模型生成,里头最好玩的应该就是「客串 (Cameo)」,你只需在录制一段简短的视频和音频(用于活体验证和形象捕捉),你就可以把自己「投放」到任何 AI 生成的场景里。

上一秒你还在办公室,下一秒你就可以出现在《沙丘》的沙漠星球上,仰望双月,Sora 还会根据沙漠的光线,给你脸上加上逼真的光影 。

是不是有点视频版 nano banana 那味了

整个过程就像拍个自拍视频一样简单。Sora 会捕捉你的形象、声音和神态,然后你就可以在生成视频时,像选择一个贴纸一样,把自己「贴」进去,而且是 3D、无缝、高度逼真的那种 。

OpenAI 内部员工已经因为这个功能在公司交到了新朋友 。

你可以和朋友们一起「客串」到同一个场景里,上演一出属于你们的科幻大片。这是一种全新的交流方式,从文字、表情包、语音,进化到了「共同体验」的视频媒介 。

在 Sora App 的信息流里,你看到的每一个视频都是 AI 生成的。

如果看到一个喜欢的视频,直接点击「Remix」,你可以修改提示词,把「赛博朋克雨夜」改成「阳光明媚的午后」,或者用「客串」功能把自己加进去,变成故事的主角 。

Sora 会保留原视频的结构或风格,让你在它的基础上进行修改和再创作,就像转发微博再加一句评论一样简单。

当然,这些功能不可避免地会引发对于隐私和侵权问题的担忧。

Sora 也对此做了应对措施,只有用户本人可以决定谁能使用自己的「客串」形象,用户可以随时撤销访问权限,或删除任何包含自己形象的视频,即使是他人创建未发布的草稿也不例外。

OpenAI 表示,包含电影或视频中真实人物影像的上传在初期将被禁止或受到严格监管,而涉及儿童的内容将有严格过滤:含有儿童的场景将实施严格的审查门槛。

现实,这次真不存在了?

Sora 2 和 Sora App 带来的,远不止是好玩,它正在从根本上动摇我们对「真实」的定义。

Sora 2 的发布,或许标志着我们与现实的关系将进入一个新的纪元。我们每个人都获得了重塑世界、重塑自我的「魔法」。

现在,我们可能不是主动选择逃离现实,而是「现实」本身正在失去其作为我们生活参照系的核心地位。

Sora App 通过提供极致的创造乐趣和社交连接,正在构建一个引力极其强大的新现实中心 。它并非在你的现实生活之外提供一个「虚拟分身」,而是在试图成为你生活的「默认背景」。

当你的社交关系(和朋友在 AI 世界冒险 )、身份认同(在虚拟世界里成为超级英雄)、创意表达(Remix 全世界 )都优先发生在这个平台之上时,那个需要你偶尔「登出」才能回去处理水电费账单的物理世界,反而会沦为一个偶尔才需要访问的「副本」。

这属实就是《头号玩家》了,所以说 OpenAI 的尽头是元宇宙?小扎默默点了个赞。

OpenAI 自己也坦言,他们曾对纯 AI 生成信息流持怀疑态度,但最终被其带来的人际连接感所惊喜 。

奥特曼在最新的博客中直言,AI 视频生成可能会走向堕落,最终导致我们都被吸入一个经过强化学习优化的「垃圾信息流」。

他表示 Open AI 试图找出如何打造一款既能带来愉悦又不落入这种陷阱的产品。

Sora 这个app,就是他们交出的第一份答卷。在通往 AGI 的路上,收获的不应该只是生产力,也关乎创造力和快乐 。

欢迎来到这个由想象力驱动的新世界。现在,唯一的问题是,你拿到邀请码了吗?

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

爱范儿 | 原文链接 · 查看评论 · 新浪微博




from 爱范儿 https://ift.tt/HR8tyKr
via IFTTT