2026年9月29日星期二

DeepSeek Harness桌面版实测:更像「个人助理」,还给你送钱

本以为 DeepSeek Harness 的桌面端会像 ChatGPT 一样直接叫 DeepSeek,没想到还是这个长长的名字。

这一次又是赶在放假之前的发布,DeepSeek 正式推出了 DeepSeek Harness 桌面端。不同于之前需要通过终端来部署安装,现在 DeepSeek 官方就提供了开箱即用的安装包。

Image

图|DeepSeek Harness 官网:https://ift.tt/dDLF0ox

打开 Harness 官网,已经可以直接下载 macOS 和 Windows 版本。

此外,现在安装 DeepSeek Harness 桌面版,登录即送 6 元赠金,有效期到 10 月 6 日。

▲ 图|梁圣也是给我们发钱了

能够常驻在本地电脑,也意味着它不再只是一个需要打开网页、输入 Prompt 才开始工作的 AI Agent,它也能像 Codex 一样开始稳定地在后台运行、定时开工,或者给自己安装新的能力。

我们也快速安装了 DeepSeek Harness 桌面版,想看看如果只是把网页里的 Harness 塞进一个桌面窗口,这件事给实际的体验能带来什么变化。

终于像是一个普通软件了

就像普通的应用程序安装一样,打开就是登录或使用 API Key。但这里的登录并不会同步我们在 DeepSeek 应用内的聊天对话,它使用的只是我们在 DeepSeek 官方开放平台的账号,使用其中的余额。

Image

而无论是使用 API Key 还是账号登录,进入之后我们就能看到熟悉的 DeepSeek Harness 的界面。几乎所有的界面交互和功能,都和此前终端版本都类似。

Image

该有的功能像是标准模式、PTC 模式、极简模式和创作模式四种不同的 Agent 预设,以及丰富的插件功能和可以自定义的第三方模型等等,DeepSeek Harness 桌面版全部都有。

不一样的是,DeepSeek 对 Harness 的定位发生了变化。

在官方这次的介绍中,DeepSeek 首先展示的并不是写代码,编程只是其中的一部分,每天的工作才是 DeepSeek Harness 桌面端更加适配的场景。

给它一个 Word,让它整理资料;给它一个 Excel,让它分析数据、生成图表;扔进去一份 PDF,让它提取信息;最后再做出一份演示文稿。

它可以直接在 Workspace 中浏览 Word、Excel、PDF、Markdown、代码等不同文件,处理完成后的结果也继续留在这个文件夹里。

Image

官方现在也把 Office 和 PDF 的预览直接做进了 Harness,在 9 月 28 日发布的 0.2.0-rc.1,还专门优化了 Office 与 PDF 的文字选择和预览体验。

我们这次也找了一个有各种文档的文件夹,里面有 PDF、Word、Excel、Markdown、图片,还有一些散乱的资料。

然后告诉 Harness:阅读这个文件夹里的所有材料,整理重要信息,核对其中的数据,最后生成一份报道大纲和一份汇报 PPT。

Image

图|还能看到有两个子智能体在工作

速度还是一如既往的快,将近 300 tok/s 的速度,然后看着它开始自己判断该读哪些文件、调用哪些工具,以及最终如何把结果交给我们。

这和之前的本地终端 Agent 类似,但现在生成的文件和每轮代码变更,会集中展示在对话中。

Image

我们可以直接在侧栏预览文件内容、查看代码差异(Diff),并通过对话继续提出修改要求;也可以随时使用本地应用打开文件进一步编辑。

这些听起来似乎都不是多么惊人的 AI 能力,但它解决的恰恰是 Agent 产品很容易忽略的事情。

模型会不会干活是一回事,人愿不愿意每天这样让它干活,又是另一回事。

桌面版另一个更值得测试的变化,是 Automation。DeepSeek 把自动化任务做成了一个默认可以按需开启的插件。

打开以后,我们可以直接告诉 Harness,「每周五下午五点,读取这个项目文件夹本周新增的资料,整理一份周报。」

Image

它会创建一个周期任务,而任务什么时候执行、下一次什么时候运行、之前有没有成功,都可以在单独的界面里查看和修改。

开启之后,即便关闭 DeepSeek Harness 桌面端,定时任务也不会被注销。

Image

这项功能在当前版本的 DeepSeek Harness 桌面端上还是实验室功能,我们需要点击插件前往开启。

在插件页面能看到,包含智能体团队、自动授权审查、自动化任务,以及语音输入在内的四项插件功能,都需要我们手动开启。

Image

其中语音输入功能还需要下载一个本地的语音识别包,包含模型、运行时和下载缓存,大小为 1 GB 左右。

看名字 SenseVoiceSmall,是一个是由阿里巴巴(阿里通义实验室 / 达摩院 / FunAudioLLM 与 FunASR 团队)推出的轻量级多任务语音理解模型。

Image

我们也测试了一下语音识别的准确性,基本上说的各种问题都能很快得到识别,并且准确。

Image

这些插件功能,至少让过去我们需要先进入浏览器的繁琐操作,简化到了点开 App 就能用的状态,并且能更好地和本地应用结合。

从 DeepSeek Harness 最初发布开始,他们就一直强调 Harness 背后的设计:Everything is a plugin。

终端是一种插件、Agent loop 是插件,还有工具、Skill,甚至交互界面,都可以是插件继续往 Harness 里面装。

这一次 DeepSeek 做的事情,是终于让普通小白用户也能容易轻松地碰到这套系统。

Image

桌面端和新版一样,增加了完整的插件管理页面。以前可能需要命令行完成的插件安装,现在只需要输入 npm 包名。

已经安装的插件也可以直接在这里查看来源、停用或者卸载。这个变化看起来只是给 npm 包加了一个图形界面,但 DeepSeek 在发布稿里提到:按照官方模型 API 用户口径统计,大约 60% 的 Harness 用户使用过第三方插件。

换句话说,插件已经已经变成 Harness 很大一部分用户真实的使用方式。

DeepSeek 接下来甚至准备建设官方插件市场,而比插件商店更有意思的是,当我们找不到想要的插件,还可以让 Harness 自己写。

Image

Agent 预设中的创作模式,就是专门用来自己生成 DSH 插件。例如直接说「帮我写一个稿件检查器插件」,接下来 Harness 会自己读取插件开发 Skill、检查可用接口、写 JavaScript、调用插件管理器安装。

大概十分钟之后,一个稿件检查器真的出现在了 Harness 自己的界面上。

Image

这个过程还是要比「AI 一次生成了多少行代码」有意思得多,因为在这里,AI 写出来的代码,会直接改变 AI 自己所在的软件。

传统软件的功能边界由产品经理和开发者决定,Harness 想尝试的,是让我们每个普通用户,也可以自己决定自己的 AI 最后是什么样。

DeepSeek Harness 的未来会是什么样

在 DeepSeek Harness 桌面版发布的官方文章里,他们也提到了下一步优化的方向。

除了让插件市场更加繁荣和安全之外,他们还会进一步强化沙箱隔离安全性,完善「智能体团队」(Agent Teams)的多 Agent 协同协作效果,并加入个性化长期记忆机制等。

此外,未来的桌面版 DeepSeek Harness 也会增加浏览器及其他桌面 GUI 软件的自动化操作,即 Computer/Browser Use 的功能,并支持远程访问与移动端部署。

Image

*封面图片原图来自 X

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/x58tLpl
via IFTTT

2026年9月28日星期一

对话一目科技:机器人还缺失的「手感」,我们用「光」来搞定丨多样性公司

当我们想喝可乐的时候,在极长的时间都只有两个选择:百事可乐和可口可乐。当我们选择手机的时候,有 90%的概率在苹果和华米 OV 等品牌里辗转。当我们买运动服饰的时候,第一时间想到的,大概率是 Nike、Adidas。

 

但世界之所以缤纷多彩,是因为在这些巨头之外,有一些不遵从传统,力求创造不同,注重设计和功能,着眼于明日的公司存在。

 

它们有着非主流的商业模式,设计、技术与产品能提供独特的用户价值,和足够的社交谈资。重点是,它们没有大公司的包袱,敢于不顾一切的进步。它们,是「多样性公司」。

 

多样性,是开放世界的关键。爱范儿相信,只有真正关注和理解多样性公司才能比更多人更早地看见未来。在同名栏目中,爱范儿将以专访的形式,与你一同见证这些多样性公司,如何重塑未来,定义新常态。

本文为「多样性公司」栏目的第 14 篇。

1983 年,威廉·吉布森用一个比喻撕开真实世界与虚拟世界的藩篱,他在《神经浪游者》的开头写道「港口上空的天色犹如空白电视屏幕」,而今天,我们正在用触觉传感器做同样的事——让虚拟世界直接伸手触摸真实世界。

一目科技是一家专注于具身智能触觉感知的硬科技企业,贯通感知、操作与部署,让机器人拥有可开发的灵巧操作能力,在真实世界可靠运行、持续进化。他们推出的视光学超薄仿生触觉传感器 SENTRA T0 厚度已迭代至 3 毫米以下,是全球最薄可量产的仿生视触觉传感器,破解了灵巧手「装不下」的行业难题。

我们和一目科技创始人 & CEO 李智强博士聊了聊为什么机器人需要触觉感知能力,触觉能力为什么如此重要,获得它为什么这么难,以及一目科技是怎么用「光」来搞定机器人触觉的。

▲ 一目科技创始人 & CEO 李智强博士

智驾永远不希望有接触,但做机器人的价值在于接触这个世界

Q1:为什么给公司取名「一目科技」,这个名字听起来和视觉更近,而不是触觉?

A:所有生命智能的开始,都是源于感知,然后再有小脑和大脑。生命智能起源于 5.25 亿年前的寒武纪大爆发,其中很重要的起点,就是三叶虫长了第一只「眼睛」,或者说是「眼睛」也不那么精确,可以说是开始有了感光的细胞和感光的器官。

我们最底层的事儿,就是把「光」给芯片化,应用在 AI 领域,推动 AI 的发展。

从寒武纪大爆发,到人工智能的拐点,一目科技希望成为 AGI 的第一只眼睛。

Q2:一目科技最开始成立的时候,其实主要是做「微光谱感知」,现在的重心转向了机器人触觉和具身智能的执行。看起来其中的跨度还是挺大的,那么其中有没有一条技术主线,或者底层逻辑主线?

A:表面看上去跨度挺大,但我们自己看来,技术底座是连续的,不是跳跃式的。

一目科技开始起步的时候,所有的能力都是围绕着「光」,把「光」的一些技术做成芯片,光芯片和 AI 结合应用在不同的领域,这个和我之前博士期间的课题是有强相关性的。当时我在卡内基梅隆大学的博士课题就是做一颗光芯片,应用在环境监测和分子分析等领域,结合了一些 AI 算法和模型,形成了我们技术认知的起点。

2015 年创立一目科技之后的第一个应用场景是做分子光谱仪,把光芯片用在光谱分析这个领域。

光这个技术呢,回过头来看,确实是一个非常非常性感的技术,可以应用在很多领域,用在通讯上,就是光模块;用在计算上,就是光计算。

我们用光来检测形变,用形变来反算受力、反馈,后来延伸到机器人触觉能力,切入到了光触觉领域。可以看到我们底层的基座能力是延续的,七八成是一致的,但是在中间要补强 AI 强相关的能力,还要对材料学有更多的研究。

Q3:目前处在行业早期的具身行业在技术上远远没有收敛,从车企智驾行业过来的创业者可能会沿用 VLA 或者世界模型的技术路线,做过智能家居的创业者会看重机器人本身的硬件架构,一目科技的出发点是传感器,感知和后续推理和执行,为什么一目科技会相信「从感知开始」会是一条更接近 Physical AI 本质的路径?

A:这是个好问题,首先我们要思考下Physical AI 的本质到底是什么,其实就是跟人类一样的「手感」。

不是让机器人在屏幕里更像人,是让它在真实世界里像人一样把手伸出去、把活干成。评判标准变了——不是「答得对不对」,是「抓不抓得住」。

按这个标准去看:类人不是某一项类人,是所有模态都得类人。

机器人的视觉已经很接近人了,摄像头加大模型,认东西比人还快;语言更不用说了。而触觉恰恰是最原始的那个模态——人还没睁眼就会摸了,可对机器来说它才刚起步。所以机器人看得见这个杯子,却不知道用了多大力、会不会滑。

所以你也能理解,为什么行业里有不同路线。智驾背景的人天然想到 VLA 和世界模型,做硬件的天然先想本体架构。不是谁对谁错,是大家习惯从自己熟悉的经验出发。

那对于我们来说,我们的第一条产品线源自我们之前就在做的光和感知,这是自己的延续性。

另外,我们也从第一性原理思考过具身智能本身的卡点和问题,我一直认为,它和传统 AI 有相似性,但也有非常大的不同。

很多人跟我说,做汽车的智驾和做机器人很接近。我觉得有些地方是类似的,但它们有非常大的一个差异。

智驾永远不希望有接触,接触了就是发生了碰撞,汽车的智驾是它不太想跟这个世界发生物理关系。

但机器人真正的价值,就在于它和世界发生了接触。

所以原来智驾的那些技术范式,放在机器人面对的物理世界,是完全不足的,甚至底层逻辑都不一样。

这是我们在行业起步看到的问题,那我就想,真正的物理 AI ,它的迭代和演进到底是什么样的过程?从第一性原理来说,人大脑的能力都是训练和学习出来的, AI 大模型的语料,文字,视频,音频这些都早已在互联网上准备就绪了,所以 AI 大模型很容易学。

但是今天来看,具身智能机器人需要的物理世界数据是不够的,那么相应模型怎么着都不可能有很好的语料,也就不会真正迭代到智能的那一天。

这就是我们的出发点,具身智能最大瓶颈是数据,数据往前推,最大的难点是采集数据。

采集这些准确数据的最重要的入口,就是感知。人的五感里,只有触觉是完全没有电子化的,这是具身智能机器人真正跟物理世界发生关系的重大卡点。

我们也想到人类学习的能力,刚生下的小 baby,一开始听觉和视觉是比较弱的,没有训练出来相应的能力。但是人类生下来就有非常好的触觉能力,小 baby 会咬东西、到处摸东西,所以你可以理解机器人现在需要的就是去把世界上的各种东西摸一遍、咬一遍,感受这个物理世界。

Q4:在一目科技的理解里,「耳听为虚,眼见为实」是不是也不成立?视觉上看到并推理「杯子会掉」,和机械手在杯子滑落的时候感受到摩擦力变化,这两种「理解」有什么本质上的区别?

A:孔子说眼见为实,后来又说目犹不可信。两千多年后,我们给的答案是:

目犹不可信时,让触觉来做裁判。

里面有几个逻辑,我们可以探讨一下,第一个就是「眼见为实」这句话。我觉得人类最牛的感知能力还是视觉,说实话这还是高智能动物获取信息最广泛、信息量最大的方式。不过视觉它可能有误判,同时视觉在操作的时候可能也有阻挡,有各种问题。

我们大脑对于视觉的计算频率是非常低的,如果眼睛看到一个东西,因为信息量太大了,大脑理解的过程是很慢的,感知端最高大概是 100Hz 左右,大脑处理端比这个还更慢,大概也就 3Hz 到 5Hz。

这就是为什么触觉在这里的表现很重要,以及为什么「眼见为实」还不够。

我们看一些论文,人在抓握一个玻璃杯时,松开再重新抓住这个过程,大概是要在 80ms 以下启动纠正,不然玻璃杯真就掉下去摔碎了,这个链路需要是非常快的。

80ms 的时间也分好几个东西,首先就是感知段,触觉感知的话是 10ms 到 20ms,要在这个时间完成感知,还有 30ms 到 40ms,大脑和小脑做完决策下发电信号到肌肉,指挥肌肉收缩,到肌肉完成收缩,重新抓住杯子还需要 20ms 到 30ms。

所以这里给到感知端的时间只有 10ms 左右,靠眼睛靠视觉是完全不够时间做这个事情的,同时在决策端 30ms 也不够,人根据视觉做一次决策可能需要一两百毫秒。

从这个例子里的各个环节来看,触觉是人类在和物理世界交互里最重要的信号之一,也是最快速响应的信号。

另外我想再解释一下,在操作层面,触觉并不是视觉的补充了,而可能是最重要的信号,因为它会形成小闭环。

▲ 机器人有了触觉和对应算法,就可以分辨真花生和石头材质假花生

AI 应该仿生,光触觉是最接近人类的触觉方案

Q5:过去几年机器人视觉能力进步非常快,但触觉的发展明显更慢。你认为今天机器人最典型的「无触觉后遗症」是什么?有没有哪些任务,人看起来觉得很简单,但机器人只靠视觉几乎永远做不好?

A:有个成语叫「无能为力」,我觉得比较能形容「无触觉后遗症」,最典型的就是看得见、干不成——机器人能准确认出这是什么、在哪儿,真一伸手就出问题:要么捏碎,要么打滑,要么装歪。

你看大家都在训练各种模型,VLA,World Model 等等,如果这些模型没有触觉,带着机器人真的下场去干活就会出各种问题,事实上也出了各种问题。

模型的泛化性肯定不够,准确率和成功率就非常非常低,很多 VLA 模型可能训练好了,但最终实现的时候,就只有五六成的成功率,这是非常差的表现。这就是因为没有触觉反馈,其他模态没办法做到想要的泛化效果和准确率。

我说一个具体的发现,我之前对汽车制造行业的理解是自动化程度非常高,各种机械臂,各种自动化的生产线,但我们去年接触一些全球头部的汽车生产大厂,其实不是那回事,大概就只有两个车间自动化程度很高,一个是喷涂车间,另一个是焊接车间,几乎是无人的。

但是到了总装车间,全是人,插拔装配线束啊,座椅啊,捋一些那种胶条儿啊,一些细小接插件啊,都是人类靠手去做。

当时对我的触动还是蛮大的,我一直以为汽车的工业自动化已经很高了,很普及了。后来我们意识到,这些东西都是缺了最后的那一点手感,缺了小模型能力,也就是机器人的小脑能力,导致机器人没法像人去完成有点复杂的装配工作。

总结下来呢,我们认为有 3 类事情是一定需要机器人触觉来帮助完成的。

第一类是有些东西,视觉具有欺骗性,比如石核桃和真核桃,看上去一样,但放手一拿,从重量,触感,实心不实心就能感知到它们的不同。

第二类是操作的东西非常柔性,我们对柔性的定义是它一般的形变规律是非线性,本身是非刚体的,无法特别准确地被规则代码预测的东西。比如汽车上的一些胶条,没有力控和触觉,机器人是完全装不了的。

第三类其实是说很多场景需要一种很微妙的手感,就像老师傅的手艺活儿,很难传承下去,就是因为老师傅自己练出来的手感。有个经典的例子,就是拿配得不太好的钥匙开门,需要一个非常特定的角度,一个固定的巧劲儿才能开锁。这个过程也是需要触觉感知才能感知,不然机器人把钥匙插进去一转就把钥匙转断了。

这个微妙的手感,无法用语言去描述、用视觉去观察,只能靠触觉反馈试探——这就是我们要把难以描述的、很精巧的手感,把它数字化、蒸馏出来,变成可以复制的模型能力,变成带触觉的物理 AI 能力。

▲ 一目科技目前量产的触觉传感器

Q6:一目为什么选择用「光」和「视觉」去测量「触觉」?在压阻、压电等等路线之外,视触觉到底解决了什么其他路线解决不了的问题?

A:你相信光吗?哈哈哈哈哈

大家现在都喜欢称视触觉,其实一目科技的路线,我们喜欢叫它「光触觉」,而不是「视触觉」。本质上我们是用光来探测形变,而不是直接给物体拍照再进行判断。

如果我们泛泛地讲,人的触觉在这几个维度上收集信息。

一是形貌学,我摸到的这个东西是光滑的,还是粗糙的,形态是什么样的,软的还是硬的。

二是力学,我按压之后会得到什么样的力反馈,这个力会不会变化,力的变化核心就是震动,震动的本质也是力在变化。

三是温度,温度也是人触觉的重要部分,我们为什么能感受到玻璃,金属和橡胶等等材质的变化,核心就是把这几维的信息叠加在一起,有一个模型判断,哦,玻璃摸起来光滑坚硬又冰凉,橡胶摸起来阻力有点大,有点软,不太凉等等。

做机器人触觉核心就是感受这几个事儿,具体是看这几件事用什么样的方法。

我还是觉得 AI 应该更仿生,更像人类。

▲ 人类触觉和光触觉机制

人的皮肤是一种柔软材质,皮肤接触到物体之后,就会产生形变,皮肤下面一个节点会有四种触觉受体,它们扮演不同角色,有的分析高频,有的分析低频,有的分析软硬等等。

我们的第一性原理决定了我们的传感器也应该是基于一种柔性材质发生形变,然后传感器接收到了这些信号,这是光触觉这条路线最不一样的,他是和真实的物理世界发生了直接的接触,产生了形变。

形变带来了几个信息,一个就是形貌学的,可以在微米级的精度探测整个物体,我就可以知道它是粗糙的还是光滑的,粗糙的话,它的颗粒度大概是什么样的?甚至在我滑动之后,还能感觉它是不是柔顺的。

第二是力学层面的,我们知道我们所用材质的杨氏模量,杨氏模量其实就是材质弹性和力的转化之间的一个个参数嘛,那我按压之后,它有形变,同时显性的物理公式,就可以转换成力的分布和变化。

所以我想说的是,光触觉的工作机理,和人的触觉是最像的,采集到的数据也跟人是最近的。

用光这种形式做检测巧妙的点是,光本身的分辨率非常高,稳定性和一致性非常好,因为我们已经有很多很好的光学芯片和光学器件被发明出来了,所以我们可以用非常好,低成本的方案去解决光探测形变这么一个事儿。

前面是从原理上讲,我们再看性能指标。

评价一个触觉传感器好不好,其实很简单,就是看它的性能指标是不是类人。人的指尖触觉是非常密的,大概 3000 个点,每个点有 4 种不同的触觉受体,也就是说有大概 1.2 万个受体点在做触觉的感知。其他的压阻或者电容触觉方案,基本上只能做到 10-100 个点,跟人的差距非常大。而我们的光触觉方案,做到了在指尖大小的面积上布置24万个点。

还有就是对力的感知精度,我们的光触觉方案可以做到 5mN 左右,再加上分辨率有 24 万个点,可以做很好的纹理检测。这些精度和特性,也是其他方案很难做到的。

还有一个重要的点,其实在机器人操作的过程中,尤其是手的抓握,最重要的不是正向的力,而是侧向的力,比如说握着滑动的杯子,保证不掉下去抓得稳的核心,是感受侧向的摩擦力,其他的几个技术方案感受不到这种力。

▲ 一目科技实验室里的触觉采集设备

Q7:光触觉有一个非常明显的工程矛盾:形变材料越软,感知通常越灵敏,但耐久性越差;越薄越适合机器人手指,制造和光学设计却越困难。你们内部有没有一个类似「不可能三角」的指标体系?为了真正商业化,主动牺牲过什么?

A:我举个例子,干物流里做搬运的重体力活,如果我手上长满了茧子,的确牺牲了一点灵敏度,但增加了耐用性和刚性,活干得其实也挺好。

回到这个问题,「不可能三角」确实存在,但是我们得把那个三角形尽量往外推,就是一方面要做平衡,一方面从底层看能不能把三角形的外延扩大。

我定义的三角第一个角是软,软本身是杨氏模量的一种体现。为什么要软呢,因为人的皮肤是非常柔软的,我们希望找到一种材料,跟人的皮肤更接近。这样的话,一方面是更仿生,探测能力和人更接近,另一方面是具体到性能参数,材料越软,对形态变化也会更灵敏。

另外一个角是回弹能力要强,一旦撤掉了力,我们希望它马上能够回到它原来的形状位置。

第三个角是耐用性。

最早的时候我们找了很多材料,确实就像你说的,想凑齐不可能三角,找平衡做取舍,最后发现,这玩意儿没法平衡,很多材料的耐用性太差了,按压 1 万次,2 万次就坏了,没法实际使用。

我们就问自己,怎么解决这个问题?

那就自研嘛,从底层开始做设计,不仅仅是改配方,改配方其实就是买来别人的东西,调一调比例,这个没法解决本质问题,反而是要从分子层面去分析我们到底要用什么样的东西,怎么去聚合这种硅基高分子材料。

柔软这种特性是和分子里的长链相关,链的长度和特性决定了柔软性和回弹力,我们要设计的是这个。

耐用性的话,除了使用过程中的损伤,就是材料本身的老化,老化的核心其实是分子间的断裂,断裂了就没法恢复。所以我们再寻找一些有趣,有价值的官能团加入,让断裂发生的难度增加,还有一种可能性就是,我们也看到一些特别有意思的新型自修复性材料。

总结一句话就是我们在分子单体上做了很多研究,去做这种聚合物,把「不可能三角」的三个角先往外推,不要每个点都很弱,首先就解决了柔软度,我们现在材料的杨氏模量和人手指的皮肤非常非常接近了,只硬百分之小几十,一些竞品一般是硬个十多倍。

另外两个角,我们现在基本上也能 cover 住,再根据具体场景在工程化上做选择,有的场景需要灵敏操作,穿针引线这种,材料可以软一点,牺牲一点力矩的范围。

Q8:目前一目科技的全球首款可规模化量产的视光学超薄仿生触觉传感器 SENTRA T0 已经做到微米级深度感知、24 万点检测分辨率,5 mN 三维力分辨率和最快 8 ms 响应。但如果真正放到机器人任务里,这些参数中哪个最决定实际成功率?有没有一些大家非常喜欢比较的参数,其实并没有那么重要?

A:我们的一个理念是在性能上跟人接近,或者超越一点就行。分辨率不需要那么高,24 万点的分辨率比人的高太多了。

还有一点就是决定成功率的不是某一个参数,是场景。

如果真要放弃一个参数的话,可能就是分辨率,做到万点级别,就足以应对大部分场景。

至于其他性能指标,我觉得挺难减配的,就说 8ms 的响应速度吧,前面也说了,慢到 20ms 30ms 的话,后续链路的计算反应时间就会被压缩,很难做到感知决策动作的闭环,这个要尽量保障的。

比如说 5mN 里的感知精度,要看具体场景,做搬运做物流分拣不需要这么灵敏,但要是绣花的话,就需要机器人触觉特别灵敏了。

Q9:一目科技的视光学超薄仿生触觉传感器 SENTRA T0 强调了可规模化量产,可以商用,一目科技怎么定义「可商用」和「实验室环境可用」的区别?是寿命、成本、一致性、量产良率,还是具身机器人厂家愿不愿意真正把它装进去?

A:我先定义一下什么叫「可商用」,什么叫「实验室可用」,这个问题说清楚了,才能知道鸿沟在哪里。

实验室可用一般来说是不追求复用的,只需要找到那一次的高光就够了,我们做实验很多时候是做 100 次成功 1 次,就可以发论文了。它对耐用性,一致性要求没那么高,只追求单一的性能参数。

商用其实是另一个极端,商用追求的是平均下来,最低的要求能迈过门槛,比如寿命和稳定性,还有一致性,不可能用几次就坏了,也不可能把实验室做 100 次成功 3 次的概率放到商用品上。

还有就是商用需要的量也比较大,实验室手搓一个出来就可以发论文,商用的触觉传感器至少也是 10 万套以上的级别。

所以说,商用和实验室的鸿沟是巨大的,大家追求的方向不一样,这也是为什么光触觉传感器到今天很难量产的原因,大部分从业者还停留在实验室阶段,没法跨越寿命,稳定性,一致性,长期使用下的漂移控制,以及大规模量产之间不同批次的差异控制等等挑战。

我们希望明年能够实现百万颗的出货量,也是铺垫了好几年,才累积出这样的能力。

▲ 一目科技机器人实验室

Q10:似乎整个具身领域都在思考怎么解决数据和数据采集的问题,通过视觉来采集人类动作给机器人模仿学习还好,采集人类触觉数据的传感器会阻隔人和物体之间的触觉,缺乏触觉又影响人类操作,进而导致采集的触觉数据失真。一目科技怎么解决这个看起来无解的问题?

A:其实不光是触觉数据采集,整个机器人的数据采集成本都会比较高,不像传统的大语言模型,可以用互联网数据,这是一个没法回避的问题。

触觉本身在机器人素材里的成本占比也没有那么高,但采集的质量怎么样?就像你说的,问题确实存在,带了手套去采集触觉数据,人类的触觉就会被严重影响,和平时的手感不一样,你要采的东西,偏偏被采集这个动作破坏了。我完全同意你说的,这个事情还没有最优解。

但有几种方式可以去做得更好。

第一就是尽量让触觉本身的影响减小,数据采集的传感器做得更柔性更轻薄更接近人类皮肤,对人类触觉感知的阻断更弱一点。

第二也是我们在寻找的新方式,只通过指尖覆盖触觉传感器,然后人手的轨迹通过其他的模式去捕捉,比如肌电信号,异构的视觉传感器来捕捉。

还有个事儿,我们观察到一个现象,就是预训练在触觉里面的作用,未必是最有用的。因为我们也在思考,人是怎么学的,大语言模型更像人读书,学知识,就是预训练为主,熟读唐诗三百首,不会作诗也会吟,先背了再说,然后会涌现出自己的见解。

人对于动作能力,物理操作能力的训练是不一样的,这个范式还没有人提到,我们可能是最先提到的,就是人学习打网球踢足球这些东西,看书学习的部分能占多少?其实不太多,就是预训练的部分很少。

打网球踢足球其实大量时间在后训练,自己练习,强化学习,挥拍的动作练几百遍,感受击球瞬间的感觉。

所以类比就是机器人的真机强化学习应该会占非常大的比例,预训练的比例会很少。

我想说的是,哪怕我们在真实世界中没有采集到那么多那么好的触觉数据,但触觉会被用到后训练里面去,用到真机强化学习的环境里面去,这需要做非常多的自我校正。在触觉数据采集成本过高,以及准确性还有与人类触觉拟合度比较弱的情况,后训练是更有用更有价值的一部分。

还有个补充是仿真数据,宇树机器人等等,行动力越开发越快的原因,一方面是因为有数据,另一方面就是可以在英伟达的 Omniverse 和 Isaac Sim 仿真平台里做步态等能力的学习和模型预训练。

除了用人和真机去采集,还不如在一些环境里把仿真能力建立起来,可能它跟人真实的触觉数据还更接近一些。

Q11:代表听觉的音频,代表语言的文本,代表视觉的有图片和视频都有标准化的数据格式,采集,传输,处理和训练都比较方便,触觉目前是不是还没有类似统一通用的标准化数据?一目科技对于这个现状是怎么思考的,有没有想过更进一步,为行业扫平标准化的障碍?

A:对,完全认同,触觉目前还缺它的「Type-C」 接口标准。

触觉本身有几个问题,硬件收敛比较晚,行业标准化是缺失的,但它确实又非常重要。我认为触觉应该是跨传感器,跨公司,跨品牌的标准化,最终都能收敛到一个标准体系里说数据的采集和数据的使用。

这事儿还远远没有完成,我们发现硬件端真正成熟量产的挺少的,品牌更少,更不要提数据量和格式了。

我们希望用 Open 的方式,更开放的方式,而不是靠 authority,权威的方式去做,靠权威很难去推动,大家都有自己的想法,我们自己的下阶段工作就是在 OpenTouch (一个低成本、高保真的机器人触觉感知与数据集采集系统)里把 TouchNet (一个开源触觉数据集项目)建立起来,把触觉数据采集、标注、存储、评测和使用的统一标准建立起来。

大家可以在这种开源数据集上各显神通,找到归一的方法,找到最好的标准模式,逐渐形成行业标准。

机器人的「iPhone 时刻」,肯定不是以一个工业品的状态出现

Q12:「大脑负责推理和思考,小脑负责感知和动作控制,身体负责具体执行」的具身智能比喻中,不少具身从业者都认为现在是身体比较成熟,但小脑不够灵活,大脑尤其愚钝的状况,一目科技怎么看这种比喻和现状,是不是和行业主流认知有所不同?

A:大方向的话,我们的认知是一致的,就是硬件本体是比较成熟的。唯一的不同想法在于手,我们认为手这块还没熟练。

小脑这块也有不太大的差别想法,也是和手相关。目前大家说的小脑还是偏下半身的小脑,跑跑跳跳,舞蹈武术这些。手部动作,尤其是手指动作,没有真正跟物体操作这个层面挂钩。可以认为现在的小脑更像智能驾驶,从 A 点到 B 点做一些动作,但不去改变物理形态和物理环境,真正能改变环境和物体的小脑能力还是缺的。

就是现在的小脑还指挥不了机器人做成熟的柔性装配,绣花编织这些手艺活。

大脑确实就是更弱了,整个的空间理解判断能力,计划能力是非常弱的。核心还是说要有实际场景的数据,触觉,力反馈来支撑操作型的小脑,然后操作型的小脑反馈到大脑的模型训练里面去。李飞飞在做的 spatial intelligence,空间智能,其实就是大脑对抓握这种空间里的各种几何形态,物理形态的理解力更强。

Q13:消费者和媒体都很想知道一个事件节点,类似于 2007 年的「iPhone 时刻」或者 2022 年的「 ChatGPT 时刻」来证明一个产品,一个技术,开启一个时代。对于机器人触觉,你觉得这个「时刻」应该由什么事件定义?是百万台机器人装上触觉传感器,是机器人第一次稳定完成过去只能由人完成的精细操作,还是出现一套真正成熟的触觉基础模型?

A:我们想想 iPhone 时刻是什么?

不是卖了多少台,也不是 iOS 多成熟,是有人第一次拿手一划,心里感叹「对了!就是这个!」。

在这个「时刻」来临之前,可能是大家已经做了非常多的努力和工作,就像 iPhone 是 2007 年发布的,但之前的 iPod,还有芯片,屏幕,触控交互,底层系统架构积累了很多年,然后才有「iPhone 时刻」。

早期版本的 ChatGPT 也可以回答一些问题,但是没有人味儿,现在的 ChatGPT 对话你就感觉很丝滑,像和真人沟通一样。

具身智能出现类似的时刻,肯定是一个令人会「Wow」一声的产品,这个东西出来之后,会让消费者觉得完成度非常高,从硬件到软件,不是一个需要调校和用户适应的产品。

这个时刻是一个瞬间,但我们为了这个瞬间在做很多外部看不到的努力,从实验室到产线,再走到大众的面前,我们崇尚真理、追求完美。

所谓时刻,就是圈里的人熬了很久,圈外的人一抬头,发现世界已经变了。

Q14:比如前不久机器人运动会上,大量人类体育记录被打破,机器人拥有超过人类的力量和速度,但因为触觉等感知能力的缺失,它们可以很暴力,但不能够「温柔」,是不是只有机器人有和人类近似的感知能力,我们之间才有真正安全的接触关系?

A:很多产品为什么你觉得它笨,不成熟,没有达到 iPhone 时刻,因为它实际上都还是工业半成品。

iPhone 出来之前,也有很多智能手机,侧滑的,用轨迹球的,用笔戳的,你总会感觉它们不完整,不完整的点是因为人还是一种挺感性的动物,不会看到一个工业半成品就兴奋起来,但是会感觉有距离感,不亲切的感觉。现在机器人的状态,我觉得更像早期的那些还带着物理键盘的智能手机,比如说黑莓。

黑莓为什么能卖这么多?因为它解决了一些商务人士的痛点。为什么又卖不了更多?因为它没有跨越工业品到用户体验卓越产品之间的鸿沟,它其实还是个办公工具。

机器人的 iPhone 时刻,肯定不是以一个工业品的状态出现,它还是要考虑很多人文的东西,体验的东西,其中有一点就是你说的,它还是要温柔的,拥有理解人的交互,而不只是说它只是个工具。

工具这种东西很难成为非常伟大的产品,无法成就某某时刻。而「关怀」和「感触」可以。触觉和力反馈,正是机器人形成人文关怀和与人类交互里面最重要的手段。

稳中向好。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/c9qxs8H
via IFTTT

可灵4.0首发实测,国产AI视频再次掀桌?

Image

2000 年,李安与摄影师鲍德熹在《卧虎藏龙》里拍下了一场经典的竹林追逐:剑锋碰撞,竹海摇曳,镜头随人物身形贴地起伏,在极速运动中留下了东方武侠的张力与气韵。

Image

大幅度动态与复杂运镜,向来是影视工业中最难驾驭的表达修辞。尽管今年已经出现全 AI 生成的 95 分钟长片,但想让 AI 制作一部诺兰水准的电影依旧有着一段距离。

这也是 AI 视频模型都在争夺的王冠,可灵也拿出了 Kling 4.0 的大版本更新,让电影级内容生成更进了一大步。

全新升级的 Kling 4.0 将于 10 月正式与大家见面,其主打「真实、可控、专业」,在画面真实感、创意可控性和叙事完整度方面实现大幅提升,并在视听表现、多关键帧、口型匹配、文字生成、创意复刻等能力上有了不小的突破。

Image

同时,可灵 AI 还推出了 Kling 4.0 Flash, 兼具高性价比与高效的生成速度,已于 9 月 28 日率先开放小范围体验,对于有高频创作需求的用户更加实用。

APPSO 也第一时间对 Kling 4.0 进行了体验,看看它能不能把我那些天马行空的想法,变成电影镜头。

能武,为大场面而生

在影视工业中,动作戏与大场面意味着燃烧的经费与极高难度的调度。对于 AI 而言,这也是最容易暴露出算力短板与模型缺陷的灾区。高速运动、连续动作、复杂的推拉摇移,往往会让画面中的物体产生扭曲,或者让空间关系彻底乱套。

我们给 Kling 4.0 设定的第一个测试案例就是宏大的危险场面。

Image

Kling 4.0 在推拉、摇移、跟拍、高位斜俯拍等大幅镜头运动中,做到了运镜不抽搐不闪变,过程连贯。

这种稳定不仅仅停留在宏大的破坏场面,同样适用于讲究招式与力量感的近身搏斗。

在一段以武侠电影为美学参考的片段中,我们考验了模型对极快剪辑与贴地写实打斗的理解。

Image

场景位于黄昏的竹林,要求逆光洒落形成金色光斑。两人欺身而上时,竹叶被剑风震落的动态,剑刃连续碰撞迸发的火花,镜头随人物身形快速横移时的呼吸感,都得到了精准还原。

双方剑势卸开后退半步时的肩膀起伏,逆光勾勒出的轮廓,复刻了武侠电影中凝重的对峙感。

像这样对贴身肉搏的精准刻画,同样体现在另一个天台激斗的测试中。从无人机俯冲建立动势,到人物纵身跃过楼顶间隙,再到近景手持晃动下的拳肘格斗, Kling 4.0 在极高频的动作切换中维持了人物特征的一致性。

Image

支撑起这些极具冲击力画面的,除了底层模型对大幅度动作的理解升级,还有一项在 AI 视频赛道中极为罕见的硬指标,那就是 10-bit HDR 与 4K 或是 1080P 分辨率的高规格输出。

市面上大部分 AI 视频生成模型输出的画面是 8-bit ,一旦进入影视工作流程,调色时一拉曲线就会出现色阶断层,暗部细节无法挽回,稍微提亮全是噪点和色块。

Kling 4.0 提供的 10-bit HDR 意味着它比普通视频多出 4 倍的色彩信息,每个通道拥有 1024 级灰阶。

Image

因此,生成的素材可以直接导入 DaVinci Resolve 或者 Premiere Pro 等专业后期软件中,满足流媒体交付标准,为后期调色提供更充足的空间。

能文,有了更多人情味

过去可灵生成的视频堪称文戏顶流,人物细腻的画质与表现仿佛让 AI 演员有了演技。

今年全网播放量上亿、被央视和人民日报转发的 AI 短片《纸手机》,就是由两个潮汕年轻人在可灵 AI 3.0 Omni 的帮助下创作出来的。

升级后的 Kling 4.0 对动作和情感的理解更强了。它进一步提升了画面真实感与人物表现,微表情、眼神流转、呼吸节奏比以往更加细腻自然。

为了验证这一点,我们复刻了《我的前半生》的名场面。

Image

在这段连续叙事中, Kling 4.0 单次原生生成最长可达 30 秒的能力得到了充分展现。它支持长镜头与连续叙事,让多段情节能够自然衔接,人物关系与故事节奏有更充分的空间建立和发展。

Image

我们还试了试致敬《沙丘》里的皇宫密谋戏,输出效果依旧不错,人物的台词和微表情都十分到位。

Image

情感的传递需要视觉与声音的精密配合。

在测试台湾新电影风格的案例时,我们模拟了一场压抑的家庭晚餐,冷蓝灰的自然光透过铁窗花洒入,胶片颗粒质感明显。这个案例的难点在于人物间疏离与欲言又止的氛围,以及粤语对白的呈现。

Image

Kling 4.0 的语言能力大幅加强,支持中文、英语、日语、韩语、西班牙语、葡萄牙语、德语、法语、印地语等 9 种语言,涵盖北京口音、中国台湾口音、东北口音、四川方言、粤语、美式英语、英式英语、印度英语等多种口音方言。

当画面中的父亲用疲惫的语气说出「仲驶讲?做咗十几年,讲执就执」,人物的口型匹配极为准确,声音、对白与表演自然同步。伴随着双通道立体声带来的空间信息,左耳和右耳听到不同的环境音,一种极度真实的日常生活压抑感扑面而来。母亲停下筷子,手指轻轻摩挲碗边的微小动作被捕捉,表现了家庭内部的生存压力。

长期以来 AI 视频创作被戏称为抽卡游戏,创作者只能通过反复修改提示词祈祷模型生成符合心意的画面。 Kling 4.0 的出现试图终结这种盲目,将控制权交还给创作者。

在单次任务中,它支持最多 15 项参考素材,可以灵活组合最多 10 张图片、 5 段视频、 7 个主体及 3 个视频主体。你可以输入主体图、三视图、宫格图、关键帧、线框图,甚至通过输入视频来参考角色表演、运镜及叙事节奏。

我们尝试了一个极具西海岸夏日风格的公路片镜头,以达到标志性的对称构图与高饱和明快色彩。利用 Kling 4.0 最多支持 10 张关键帧输入的功能,我们自由设定了关键画面节点,精准指定人物状态与情节节点,让内容按照预设方向自然推进。

Image

奶油色老式敞篷车在正午刺眼的阳光下行驶,跳切剪辑将车内朋友欢笑的瞬间快速拼贴。正面驶来时挡风玻璃上反射的对称街景,后视镜里倒映出的飞驰棕榈树,都丝毫不差地遵循了设定的构图逻辑。

Kling 4.0 还支持 21:9 超宽画幅,这个比例接近 2.35:1 的好莱坞电影主流宽银幕。模型在训练和输出时考虑了电影级构图,完全省去了后期二次裁切丢信息的麻烦。

得益于它进阶的提示词理解能力,Kling 4.0 进一步拓宽了创作场景的边界,覆盖电影感、动画、奇幻、像素风、毛毡、 3D 赛博、 Vlog 、写实纪录片等多元视觉风格。

APPSO 也总结了一些写出好用提示词的技巧:

我们可以考虑使用专业的摄影机运动指令,例如「一镜到底跟拍」「跳切」等。同时,通过直接引用特定导演的美学风格和特定的画面质感,锁定视频的视觉基调。

Image

在混合使用多个参考图或参考视频时,需要制定严格的参考优先级与分工机制。例如,明确规定某段参考视频只负责提供物理运动、内部剪辑和运镜节奏。

Image

而环境、人物五官、服装和载具外观则必须严格继承自特定的参考图片,最好在生成视频之前先生成一套详细的资产库。这能有效防止 AI 将原视频中不需要的元素带入新生成的画面中。

Image

掌握这些技巧后,多尝试调整动词和镜头词汇,慢慢就能形成自己的提示词素材库。

在画面的文字渲染痛点上, Kling 4.0 支持多语种文字、 Emoji 与 Logo 清晰稳定生成。即使在画面运动与场景切换等动态变化中,文字也能保持清晰稳定,告别了店招乱码与字幕鬼画符。

针对高频创作场景,目前推出了 Kling 4.0 Flash 版本,它生成速度更快,极具性价比,大幅降低了视频创作门槛。配合视频精准编辑功能,创作者可以针对原视频中的角色表情、肢体动作、镜头机位、整体风格和视频背景进行精准修改增加或删除,保持画面其余部分稳定,减少反复生成。

创意复刻功能支持对参考视频的叙事节奏与镜头编排进行借鉴,替换其中的商品与角色,将成熟创意快速转化为自有内容。 Kling 4.0 正在将 AI 视频从猎奇向专业的电影级创作流程平稳过渡。

100% 忠于自我的电影时代

最近,有采访问戴锦华老师:您始终没有真正投身于电影工业里面,而是选择留在学校,研究、教学,这算是一种遗憾吗?

戴锦华老师回答说:不遗憾。首先是因为创作没诱惑过我。我很清楚地知道我不能成为优秀的创作者,而我不想做末流的事。其次,电影的创作是一个集体性的创作,说得直白一点,是需要统治术的。后者是我的身心所拒绝的。

电影也是一门「妥协的艺术」,因为每多一个人参与,创作者脑海中那个让人起鸡皮疙瘩的初始创意就会在传递中损耗一分。

以往我们惯常谈制作成本的下降以及模型能力的提升如何让更多人成为了「草根导演」(这里的制作成本指时间与金钱),但这句话背后有着更复杂的面向。

一方面,AI 也消解了创作中的沟通成本。对于那些性格内向、不懂得或不愿与人周旋合作的创作者来说,AI 赋予了他们默默创作的可能。他们不再需要去修炼令人生厌的「管理学」,可以更少地妥协,百分之百地听从自己内心的声音。

通过 Kling 4.0 全面进阶的模型能力,创作者只需凭借自身,就能与 AI 共同组建起一支「全能的创作班底」。从多关键帧的精准调度,到最多 15 项素材的全能参考,再到针对各种细节的精准编辑,它在创作的每一个环节都给到了全方位的支持。

另一方面,制作成本的下降以及模型能力的提升不会使得更多人平白无故产生了创作热情,而是让那些本身就很有表达欲和好奇心的人的热情更大地迸发出来。

那些曾会轻易摧毁创作热情的因素变得越来越弱了。

当创作不再需要妥协,当脑海中那个让你兴奋的 idea 终于能被完整看见,一个属于个体的、100% 忠于自我的电影时代,才刚刚开始。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。



from 爱范儿 https://ift.tt/yUwCox5
via IFTTT