← 返回历史归档English
NeuronX · 一手 AI 日报 · 不读二手

模型比拼之外,AI 代理开始争夺工作入口Gemini 4 Argon 亮相;OpenAI 把常驻代理、电脑操作和开发接口推到台前。

2026年10月1日 周四 来源 · follow-builders · Latent Space(含 AINews 专栏)· AI Valley · YouTube
关于本期:本日报由公开信息源(X/播客/博客、订阅简报与 YouTube 频道)自动梳理、归类、改写。每条均附原始链接,请以原文为准;AI 改写可能有疏漏,欢迎对照核查。

今日一句话

Google 推出 Gemini 4 Argon,主打编程、知识工作和网络防御,但目前仅有限开放。 OpenAI DevDay 的另一条主线是让 AI 代理持续工作,并通过电脑操作和开发接口接入真实流程。Google Labs 与 Vercel 也在简化重复任务和服务连接。代理能做的事越多,权限、凭据和操作失误就越需要看清楚。

展开口播文字稿
今天的主线,不是又有哪个模型刷新了榜单,而是 AI 正在从回答问题,走向接手一段真实工作。Google 推出 Gemini 4 Argon,强调编程、知识工作和网络防御;OpenAI 则把常驻代理、电脑操作和开发接口放到了台前。今天我想重点聊透三件事:模型的亮点该怎么判断,代理究竟怎样完成任务,以及它进入工作流程以后,权限和失误为什么会变得重要。这几件事连起来看,比单看一次发布更能说明,AI 正在争夺的到底是什么入口。 先看模型。Google 推出了 Gemini 4 Argon,给它选定的方向包括编程、企业知识工作和网络防御。Google 称,在公布的十九项基准中,它有十三项排名第一。这个成绩值得注意,但听到这里,我建议你先停一下:公布的基准成绩,是在特定评测条件下得到的结果;一个人在自己的工作里能不能用上、用起来是不是顺手,是另外两个问题。这不是说基准没价值,而是说它回答的是“在这些测试里表现怎样”,并不自动回答“我明天能不能把它接进自己的工作”。Argon 初期只向特定政府用户和可信网络防御人员开放,所以对多数人来说,眼下还无法亲自检验它在日常任务里的表现。把“成绩突出”和“普遍可用”分开,是理解这条消息的第一步。 这里还有一个很容易听岔的数字:最高一百万输出 token。token 可以粗略理解为模型处理文字时使用的计量单位,但它不等于一个汉字,也不等于一个词。更重要的是,这里说的超长输出,要借助 Long Decode Continuation 来实现。按今天素材的描述,它允许一个长回答在多次调用之间暂停,再接着往下生成。你可以把它想成一项很长的写作任务,不要求一次从头写到尾,而是做到一处先停下来,之后沿着已有内容继续。这和普通的一次调用就吐出一百万 token,不是一回事。如果只记住“一百万”,忽略“多次调用之间续接”这个条件,就会误判这项能力适合怎样的任务。 那这种续接能力为什么值得聊?我个人的理解是,它把注意力从“单次回答能有多长”,转向了“一个很长的任务能否被持续推进”。假设你要处理一份篇幅很长的材料,或者让模型完成一个不能靠短回答交差的工作,能够暂停和续接,听上去就更贴近实际需求。但这只是对功能用途的理解,不代表它已经在这些假设任务里得到验证。真正需要观察的,是续接之后能否保持任务方向,前后内容是否协调,以及整个过程对使用者是否便利。今天的素材没有给出这些实际任务的结果,所以我不会把“最高输出量”直接讲成“已经能可靠完成任何超长任务”。数字告诉我们能力边界被怎样描述;使用体验,还要等更多人有机会接触后再看。 另一边,OpenAI 的 Thibault Sottiaux 谈到 GPT-6.1 Sol:它在 A P I 和订阅端的需求都很高,ChatGPT 与 Codex 因此承受了较大负载。这里的 A P I,你可以把它理解成应用调用模型能力的接口,而不是用户直接打开聊天界面来使用。Sottiaux 说团队已经增加容量,预计接下来几小时速度会改善,可能接近前一天的两倍。注意,这是一项当时对后续速度的预期,不是说已经完成测速、确认翻倍。把这条消息和 Argon 放在一起看,恰好能看到模型竞争的两个面:一面是能力指标和新功能,另一面是当很多人同时来用时,服务能否稳定、快速地把能力交到他们手里。对开发者来说,后者并不是附带的小问题。如果一项工作需要连续几步完成,中途等待变长,整个流程的感受就会跟着改变。所以我看模型发布时,会分别问:公布了什么成绩?实现功能有什么条件?谁现在能用?真正用起来的速度和稳定性怎样?这四个问题不能用一个漂亮数字代替。 说完模型本身,我们往前走一步:如果模型不只回答一句话,而是要替你把事情做下去,它还需要什么?OpenAI 在 DevDay 展示的 Dots,是一个可以持续运行的 AI 代理,配有云端电脑,也能在需要时请求用户介入。这里的“代理”,不要先想成一个抽象的新物种;你可以把它理解为接到目标以后,尝试自己推进若干步骤的助手。普通聊天更像你问一句、它答一句;常驻代理强调的是任务没有在一次回答后结束,它可以继续工作,遇到需要你决定或处理的环节,再把你请回来。这个区别很关键,因为一旦系统能持续推进任务,我们评价它的方式也要变:不只是某一句回答写得好不好,还要看它在一连串步骤里做了什么、何时停下、何时请人介入。 关于 Dots 的展示,需要把已知和未知分清。今天的素材提到,OpenAI 发布了一条演示视频,视频的标题和简介显示了旅行规划、整理用户反馈以及跟进 Slack 等场景。但素材没有取得视频字幕,我们不能据此讲出演示里每一步具体怎么操作,更不能说它在这些场景中达到了怎样的效果。尽管如此,光看这些被点名的场景,产品想进入的工作范围已经很清楚:它不满足于在对话框里给出建议,而是希望围绕一个目标,处理信息、使用软件,并在过程中和人保持联系。至于它实际做得有多顺畅,演示中遇到什么问题、怎样解决,今天的信息不足以判断。深度看一项代理发布,有时候最重要的不是替它补全一个精彩故事,而是准确地指出:它已经展示了什么,我们还没看到什么。 代理要推进任务,光能持续运行不够,它还得知道自己面前的软件是什么状态。这就进入电脑操作代理的话题。Latent Space 采访了 OpenAI 负责电脑操作的 Ari Weinstein,谈到代理如何结合截图、无障碍信息、网页结构和生成的代码来操作软件,以及如何从失败中恢复。听起来术语多,其实可以从你自己用电脑的经验理解:你看到屏幕上的布局,会辨认哪些地方能点;有时你还会借助页面本身提供的结构信息,知道某个按钮、输入框或内容区意味着什么。对代理来说,截图是画面上的线索,无障碍信息和网页结构是关于界面组成的另一类线索,生成的代码则可能成为执行操作的一种方式。它并不是只能“看见一张图,然后猜该点哪里”。 多种界面信息放在一起,为什么有价值?因为软件界面并不是一张永远不变的静态海报。你做完一步,屏幕可能换了内容;你以为操作成功了,结果可能没有发生;一个看起来相似的位置,也未必对应同一个功能。所以电脑操作不只是“找到按钮并点击”,还包括操作之前判断状态,操作之后核对结果,如果和预期不一样,再决定下一步。采访里讨论了从失败中恢复,这个方向本身很重要:真正的工作任务不会保证每一步都顺利。但我也要留一个边界,关于速度和能力的判断,今天素材里属于受访者的说法,不是我们拿到了独立测试结果。我们能据此理解它的设计思路,却不能把“讨论如何恢复”说成“各种失败都能可靠恢复”。 把这个问题再往下拆,你会发现“请求用户介入”不是一个可有可无的装饰。设想一个代理正在整理资料,碰到一个它无法确认的选项:它是继续猜,还是暂停来问你?这只是帮助理解的假设,不是 Dots 演示中已经发生的情节。可它说明了一个真实的产品设计问题:代理越想独立完成任务,就越需要划清哪些步骤可以自行推进,哪些步骤应该交还给人判断。如果它每走一步都问,持续运行的意义会被削弱;如果它遇到不确定之处也不问,失误就可能沿着后续步骤传下去。一个称得上好用的代理,不能只看最终有没有给出一个“完成了”的提示,还要看它怎样处理过程中的不确定,以及用户能否理解它为什么在某个时刻停下来。 除了操作屏幕,代理还要和外部工具相连。OpenAI 的 Thibault Sottiaux 表示,现在可以直接通过 ChatGPT 构建、部署 M C P 服务器,并限定谁能访问,或者把它公开。M C P 在这里可以理解成一套让 AI 接入外部工具或资源的接口约定;M C P 服务器,就是按这套约定向 AI 提供工具或资源的服务。换一个生活化的说法:代理想办事,不能永远只在自己的纸上写计划,它需要知道哪里有可用的工具,以及该怎样按约定使用。今天这条更新值得注意的地方,不只是“创建接口变得方便”,还在于创建、部署和设置访问范围,被放进了同一个流程。你在决定让代理能够接触什么的同时,也得决定哪些人能够使用这个连接。 为什么我反复强调访问范围?因为“能连接上”和“应该让谁连接”不是同一个问题。假设你做了一个供代理调用的工具,只给特定人用,与把它公开,意味着完全不同的使用边界。这仍是说明概念的假设,不是在说今天某个服务已经出现了问题。工具一旦被接入工作流程,权限就不再是事后补一张说明书,而是功能本身的一部分。你不能只问,代理有没有调到需要的工具;还得问,它是在什么授权下调用的,谁能发起这种调用,使用者能不能看清自己开放了什么。今天素材并没有给出这项功能的安全评估,所以我不会凭“可以设置访问范围”就推断风险已经被解决。它说明的是:产品正在把权限设置摆上台面,而这件事必须被认真对待。 接下来是代理背后的开发接口。Latent Space 同一篇访谈中,OpenAI A P I 团队的 Nikunj Handa 介绍了异步工具调用、运行中调整指令、WebSockets 和 Decisions A P I 等能力。名称听起来偏工程,我换个角度说。异步工具调用,针对的是代理调用一个工具时,不必什么都停下来、一直等它返回;运行中调整指令,针对的是任务做到一半,人的要求可能变了,系统需要接住新指令;更及时的应用通信,则是在解决代理和承载它的应用之间,信息怎样跟上任务进度。WebSockets 和 Decisions A P I 是这组开发能力里被提到的名称;今天的素材没有逐项提供完整技术规格,我们把它们理解到“帮助代理更及时地和应用协作”这一层就够了,不需要假装已经看到了全部实现细节。 这些接口为什么和普通听众也有关?因为你最终感受到的代理,不是模型、工具和应用各自单独工作的样子,而是它们串起来之后的样子。想象你给出一个任务,代理需要读取现状,调用工具,等结果,再根据结果走下一步;这时你又补充一句“刚才那个条件要改”。如果系统只能在最初接收指令,后面的步骤就可能沿着旧要求继续走。如果它能在运行中接住新要求,体验就更接近你和一个正在办事的人协作。当然,“更接近”不等于它已经能妥善理解所有临时修改。这里想说明的是,开发接口看似藏在后台,实际决定了代理能否及时响应人,以及长任务是否只能僵硬地一路跑到底。 访谈也谈到长任务的缓存和上下文压缩。上下文,可以理解成代理眼下拿来判断下一步的任务记录和相关信息;压缩,则是面对越来越长的过程,设法把重要内容保留下来,而不是让每一步都背着全部细节往前走。这个解释只是帮助你理解讨论的方向,今天素材没有提供具体方案的性能数据。为什么长任务尤其需要考虑它?因为任务走得越久,代理遇到的指令、工具结果和中间决定就越多。它需要知道哪些信息仍然关键,哪些只是已经过去的一步;但如果压缩时把重要约束丢了,后面也可能走偏。于是你会看到,所谓“常驻代理”并不只是让程序多运行一段时间。它同时是界面理解、工具连接、通信响应,以及长期保持任务脉络的一整套问题。 现在我们可以把 OpenAI 的几条消息拼成一条链了:Dots 代表持续推进任务的产品形态;电脑操作让代理尝试在软件里观察和行动;M C P 服务器提供连接外部工具的一种方式;开发接口让任务中的调用、调整和通信有办法配合。链条里任何一环不顺,用户看到的都可能是“它没把事办好”。也正因为链条变长,成功的标准不能只是一句“代理完成了任务”。它完成的是不是你原本授权它做的事?中途有没有遇到需要你判断的地方?调用外部工具时,访问范围是否合适?出现偏差之后能不能停住并让人看明白?这些问题,在一次简单问答里不一定显眼;到了持续运行的代理里,却会越来越接近产品体验的核心。 说完代理怎样行动,再看看它怎样进入我们已经在用的工作流程。Google Labs 表示,Gemini 中的 Skills 已面向全球推出,可以在聊天中保存自定义指令,自动处理重复任务。这里的 Skill,不必想得太玄:你可以把它理解成一套可复用的做事要求和步骤。假设你常常希望用同一种方式整理一类内容,每次都从头解释一遍会很累;能把自己的要求保存下来,下次再用,重复工作就有机会被压缩。这个假设只是在解释功能,不是说 Google 已经公布了某项任务节省了多少时间。事实上,今天素材明确没有提供节省时间的量化结果。我们知道的是功能推出了,不知道每个人在不同任务上会节省多少。 Google Labs 还把 Skills 与此前探索工作流定制的 Opal 实验联系起来。这条线索告诉我们,重点不只是让模型“回答得更聪明”,还包括让用户把自己的做事方式留下来,之后反复调用。你可能会发现,这和刚才的常驻代理讨论处在不同位置。Skills 更多处理“我想怎么做这件事”:哪些指令常用,哪些步骤值得复用;代理连接工具则处理“按这些要求做事时,能去哪里取得信息、完成操作”。先把重复要求固定下来,再让系统触达完成任务所需的地方,才更像一条完整的工作流。不过,步骤可复用,不代表每一次具体任务都完全一样。你仍然需要判断保存下来的要求,是否适合眼前这次情况。这也是为什么功能推出之后,真实使用方式比名称本身更值得观察。 再看 Vercel 推介的 Connect。Vercel 的首席执行官 Guillermo Rauch 邀请服务提供者加入 Connect,让应用和代理更容易接入服务。他的判断是,构建应用的难点正在转向“连接已有服务”,而让每个代理分别持有静态密钥会带来麻烦。所谓静态密钥,你可以把它想成一份用来证明“我有资格访问”的凭据;这个类比只为说明它为什么敏感,不代表所有具体服务都采用同一种做法。如果每个代理都各自拿着这样的凭据,那么代理变多、连接变多以后,谁持有什么、什么时候还能用,就可能更难理清。Rauch 提出的方向,是希望把连接服务这件事做得更容易;至于 Connect 实际能把凭据问题解决到什么程度,今天没有独立验证,不能提前给出安全结论。 Skills 和 Connect 放在一起,恰好是工作流的两端。一个从个人的指令和重复步骤入手:下次遇到相似的事,不必每次重新交代。另一个从应用和服务之间的连接入手:代理想继续往下做时,不至于只停在聊天窗口里。它们都在降低把 AI 放进日常工作的门槛,但降低门槛,也会把新的问题带到眼前。原先只是保存一句写作要求,和后来允许一个代理触达外部服务,涉及的权限并不一样;原先只是得到一段建议,和后来让系统执行操作,失误的影响也不一样。我个人的理解是,工作流产品下一步比的,不会只有“接入得快不快”,还会有“边界让不让人看得懂”。这是一种基于今天这些发布方向的推断,不是素材中已经得到证实的行业结论。 沿着“看得懂边界”往外看,还有一条关于可信内容的消息。Google DeepMind 发布了一期视频,由 Hannah Fry 与 Pushmeet Kohli、Jeremy Ratcliffe 讨论 AI 水印。视频标题和简介显示,话题包括 SynthID,以及水印在文本、图像、视频和生物领域的应用。这里先把“水印”讲明白:你可以把它理解成一种为内容提供来源线索的技术思路,让人有机会判断内容与生成过程之间的关系。这个说法只是概念解释,并不是在断言某一种水印能够解决所有来源判断问题。尤其需要注意,今天没有取得这期视频的字幕,所以我无法告诉你几位讨论者在视频里提出了什么具体论证、展示了什么实验,或者最后得出了什么结论。 为什么在代理和工作流之外,还要提可信内容?因为当 AI 既能生成内容,又能进入工具、推动任务时,我们会越来越需要区分“这份内容从哪里来”“它代表了谁的操作”。水印讨论更直接针对内容来源;代理权限讨论针对谁允许系统做什么。两者不是同一项技术,却都和可辨认、可追问有关。这里我是在做横向理解,不是在说 SynthID 已经被用于今天提到的代理流程,更不能把视频简介当成跨领域有效性的证明。素材能支持的判断比较克制:AI 生成内容如何标明来源,仍是值得关注的技术问题;这期视频把相关话题带到了讨论中。具体效果和适用边界,还需要看到比标题、简介更多的信息。 技术之外,再看看人和企业会怎么接住这些变化。Box 的首席执行官 Aaron Levie 认为,把 AI 真正部署进企业经济活动中,是一个重要机会;但更换企业工作流所需的工作量,往往超出预期。他还指出,这可能体现在软件和代理上,也可能带来新的服务需求。请注意,这是他对机会和落地难点的判断,不是说企业工作流已经普遍完成改造。为什么这句话值得放在今天?因为它给前面的发布补了一块现实背景:工具能做某件事,不等于企业现有的工作方式会立刻为它让路。一个流程里面有人做决定,有软件承接步骤,也有谁能访问什么的安排。要让代理真正发挥作用,光演示它会操作还不够,还要让这些环节接得上。 我个人的理解是,企业采用代理的难处,很可能不只在某一个模型够不够强,而在“原来的流程要怎样改,改完之后谁负责看住它”。这是从 Levie 的观点和今天几条产品消息做出的推断,不是对所有企业情况的事实陈述。你可以用一个很朴素的问题检验这层逻辑:如果原来一项工作由人确认后再进入下一步,现在想让代理接手其中一段,那原来的确认点放在哪里?如果保留,代理如何在合适的时候停下;如果调整,又由谁决定它可以继续?今天的素材没有给出某家企业的实施案例,所以不需要编造答案。但把这些问题摆出来,就能理解为什么“更换工作流”会比“试用一个新功能”复杂得多。发布会展示的是能力入口,真正落地考验的是流程能否围绕它重新安排。 另一个视角来自投资人 Nikunj Kothari。他说自己已经把大部分工作自动化,但寻找并联系创业者、与创始人见面,以及撰写不投资的说明,仍由他亲自完成。他特别提到,每一份不投资的说明都是自己手写的。这是一个人的工作经验,不能直接推成“所有岗位都必须把这几件事留给人”。但它很适合提醒我们:讨论自动化时,不必只问“能不能自动做”,还可以问“做这件事时,人希望保留什么”。有些任务也许可以被工具协助,却仍有人选择亲自投入。这个选择背后的具体原因,今天素材没有展开,我不替他猜;我只想指出,自动化的范围和个人愿意交出去的范围,并不总会完全重合。 把 Levie 和 Kothari 的观点并排听,正好能避免两种过于简单的想象。一种是,新代理一出现,企业就会自然换掉旧流程;另一种是,只要一件事带有人情味或判断,就完全不可能用工具协助。今天的素材没有支持这两种绝对说法。Levie 强调流程改造的工作量,Kothari 描述自己具体留下了哪些亲自做的事。他们谈的层次不同:一个偏企业落地,一个偏个人工作选择,但共同把问题从“AI 能做什么”拉回了“我们准备怎样使用它”。这也解释了为什么权限、介入和操作记录会被反复提起:当人决定交出一部分步骤时,他需要知道自己究竟交出了哪一部分,又在哪些地方仍然握着决定权。 现在把今天几条主线放在一起看。Gemini 4 Argon 告诉我们,模型仍在展示新的能力指标,但开放范围和使用条件必须一起看;GPT-6.1 Sol 的负载消息提醒我们,能力还要通过足够快、足够稳的服务才能被感受到。Dots、电脑操作和开发接口,代表 AI 正在尝试把“回答”延伸成“持续完成任务”;Skills 和 Connect,则分别瞄准重复步骤的复用、以及外部服务的接入。内容水印的讨论、企业流程改造的观点和个人保留亲自处理的工作,又不断把我们拉回同一个问题:当系统能做得更多,我们怎样知道它在做什么、凭什么做、做到哪里该停?我认为,这正是“争夺工作入口”最具体的含义。入口不只是谁占据一个聊天窗口,而是谁能把能力接进一段可持续、可授权、可检查的工作过程。 接下来我会重点盯三件事。第一,Gemini 4 Argon 何时向更多开发者开放,那个借助续接实现的百万输出,在实际长任务里究竟怎样表现;第二,OpenAI 扩容之后,ChatGPT 和 Codex 的速度是否如当时预期那样改善;第三,也是我觉得会越来越重要的一点,常驻代理接入更多应用以后,产品怎样处理授权、凭据和操作失误。今天我们已经看到了模型、代理和连接工具分别往前走,但它们能否组成让人放心使用的工作方式,还需要继续观察。以上就是今天这期《AI内参日报》,我们明天见。

🚀模型与发布

今天的模型消息,既要看能力,也要看开放范围和实际使用体验。

Latent SpaceGoogle 推出 Gemini 4 Argon,百万输出靠续接功能实现发布

Google 推出面向编程、企业知识工作和网络防御的 Gemini 4 Argon;Latent Space 的 AINews 专栏与 AI Valley 都提到了这次发布。Google 称它在公布的 19 项基准中有 13 项排名第一,但初期仅向特定政府用户和可信网络防御人员开放。其最高 100 万输出 token 要借助 Long Decode Continuation,在多次调用之间暂停、续接长回答;这与普通单次调用的输出上限不是一回事。

读原文 →
XGPT-6.1 Sol 需求高,OpenAI 称正在扩容运行状况

OpenAI 的 Thibault Sottiaux 表示,GPT-6.1 Sol 在 API 和订阅端的需求都很高,ChatGPT 与 Codex 因此承受较大负载。他说团队已增加容量,预计接下来几小时速度会改善,可能接近前一天的两倍;这是当时的预期,不是已完成的测速结果。

读原文 →

🔍 深度解读:Argon 的亮点是能力指标和超长输出,但有限开放意味着多数人暂时无法亲自验证;Sol 的消息则提醒我们,模型能力之外,服务能否稳定、快速地交付同样影响体验。比较模型时,需要把厂商公布的成绩、功能适用条件和实际可用性分开看。

🤖代理与开发平台

从常驻代理到电脑操作,发布重点正从“回答问题”转向“完成任务”。

AI ValleyOpenAI 展示常驻代理 Dots代理

AI Valley 介绍了 OpenAI 在 DevDay 发布的 Dots:可持续运行的 AI 代理,配有云端电脑,并能在需要时请求用户介入。OpenAI 今天还发布了一条 Dots 演示视频;其标题和简介仅表明视频展示了旅行规划、整理用户反馈及跟进 Slack 等场景。该视频没有取得字幕,不能据此判断演示的具体过程或效果。

读原文 →
XChatGPT 可直接构建和部署 MCP 服务器开发工具

OpenAI 的 Thibault Sottiaux 表示,现在可以直接通过 ChatGPT 构建、部署 MCP 服务器,并限定谁能访问,或将其公开。MCP 可以理解为让 AI 接入外部工具的一种接口约定;这条更新把创建接口与设置访问范围放进了同一流程。

读原文 →
Latent Space电脑操作代理开始结合多种界面信息电脑操作

Latent Space 采访了 OpenAI 负责电脑操作的 Ari Weinstein,讨论代理如何结合截图、无障碍信息、网页结构和生成的代码来操作软件,以及如何从失败中恢复。这里的重点不是代理只会“看图点按钮”,而是它可以利用多种信息判断界面状态;采访中关于速度和能力的判断仍属于受访者的说法。

读原文 →
Latent SpaceOpenAI 介绍面向更快代理的开发接口开发接口

同一篇 Latent Space 访谈中,OpenAI API 团队的 Nikunj Handa 介绍了异步工具调用、运行中调整指令、WebSockets 和 Decisions API 等能力。通俗说,它们分别涉及让代理不必一直等工具返回、在任务进行时接受新指令,以及更及时地与应用通信。访谈也讨论了长任务的缓存和上下文压缩。

读原文 →

🔍 深度解读:这几条消息拼出了一条任务链:代理要能持续运行、看懂并操作软件,还要连接外部工具,开发接口则负责让整套流程更及时地响应。能力扩展的同时,访问范围和授权方式也成了产品设计的一部分,不能只看代理是否完成了任务。

🔌工作流与连接

把 AI 接入日常工作,正在成为独立的产品战场。

XGoogle 将 Skills 推向 Gemini工作流

Google Labs 表示,Gemini 中的 Skills 已面向全球推出,可在聊天中保存自定义指令、自动处理重复任务。Google Labs 将它与此前用于探索工作流定制的 Opal 实验联系起来;这条消息说的是功能推出,并未提供节省时间的量化结果。

读原文 →
XVercel 推介 Connect,强调服务接入与凭据问题服务连接

Vercel CEO Guillermo Rauch 邀请服务提供者加入 Connect,让应用和代理更容易接入服务。他认为,构建应用的难点正转向“连接已有服务”,并指出让每个代理分别持有静态密钥会带来麻烦。这是 Rauch 对产品方向的阐述,不等于 Connect 的安全效果已经得到独立验证。

读原文 →

🔍 深度解读:Skills 处理的是如何复用个人的指令和步骤,Connect 关注的是如何把代理接到外部服务。两者处在工作流的不同位置:先让任务可重复,再让它触达所需系统;连接越广,凭据和访问控制就越重要。

🔬研究与可信内容

AI 生成内容如何标明来源,仍是值得关注的技术问题。

YouTubeGoogle DeepMind 发布介绍 SynthID 水印的视频视频更新

Google DeepMind 发布了一期由 Hannah Fry 与 Pushmeet Kohli、Jeremy Ratcliffe 讨论 AI 水印的视频。标题和简介显示,话题包括 SynthID,以及水印在文本、图像、视频和生物领域的应用。由于没有取得字幕,这里不推断视频中的具体论证、实验结果或结论。

读原文 →

💬观点与争论

工具进步很快,但人的工作和企业流程会怎样变化,仍存在不同判断。

XAaron Levie:把 AI 部署进企业,难点在改造流程行业观点

Box CEO Aaron Levie 认为,将 AI 真正部署到企业经济活动中是一个重要机会,因为更换企业工作流所需的工作量往往超出预期。他指出,这既可能体现在软件和代理上,也可能带来新的服务需求。这是他对市场与落地难点的判断,并非已发生的行业定论。

读原文 →
XNikunj Kothari:一些投资工作仍要亲自做个人观点

投资人 Nikunj Kothari 说,自己已将大部分工作自动化,但寻找并联系创业者、与创始人见面,以及撰写不投资的说明,仍由他亲自完成。他特别提到自己会手写每一份不投资的说明。这是个人工作经验,不能直接推广为所有岗位的自动化边界。

读原文 →

🔑本期三关键词

KEYWORD 01
Long Decode Continuation
让长回答在多次 API 调用之间暂停并续接的功能。
KEYWORD 02
MCP 服务器
按 MCP 接口约定,向 AI 提供外部工具或资源的服务。
KEYWORD 03
电脑操作代理
尝试读取软件界面、执行操作,并根据结果继续完成任务的 AI 代理。
值得继续观察(观察坐标,非预测、非建议)
📺 今日频道更新 · 3
NeuronX · 不读二手
每天替你读完 AI 圈的英文一手信源:原文、公告、当事人的话。每条附原始链接。
RSS 订阅