报名参加CloudWeGo黑客松,奖金直推双丰收! 了解详情
写点什么

谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?

  • 2024-11-11
    北京
  • 本文字数:2467 字

    阅读完需:约 8 分钟

大小:1.10M时长:06:26
谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?

整理 | 华卫、核子可乐


一场意外泄露事件后,谷歌这位科技巨头无意之中证实了其先进人工智能“Jarvis”的存在。据了解,Jarvis 能够访问网站、在获得用户许可的情况下进行在线购物,甚至填写表格。基于 Chrome 平台的 AI,也将是这款浏览器自 2008 年推出以来规模最大的功能升级。


不久前,谷歌意外泄露了最新 AI 发展成果 Jarvis 的“内部预览版”。Jarvis 原本是《钢铁侠》电影中 Tony Stark 的人工智能助手的首字母缩写词,全称为 “Just Another Very Intelligent System”。就像《钢铁侠》电影一样,Jarvis 应该是一个代理型人工智能,即只需要很少或不需要人类输入就能执行任务的自主系统。


被泄露的文件最初被发布在谷歌自己的云平台之上,在存留期间,其内容显示谷歌打造了一款能够浏览互联网并自主检索信息的 AI 智能体。


Jarvis 或将接管 Chrome 浏览器


据外媒报道,该 AI 智能体于本周二在 Chrome 浏览器网络商店中作为扩展程序短暂提供下载,并被描述为 “与你一起上网的好伙伴”。


可惜的是,该扩展程序虽然可以下载,但需要某些用户无法绕过的访问权限。有人在该扩展程序被删除之前抢先完成了安装,但尚无法正常使用。当天晚些时候,该扩展程序已从网络商店删除。


Jarvis 无意中出现在 Chrome 浏览器网店上,证实了之前有关谷歌正在开发这一产品的报道。


10 月底,有外媒报道称,谷歌也正在开发一种可以通过简单命令来接管计算机的 AI 工具,该工具在内部被称为 Project Jarvis,能够代表用户浏览网页,并执行购买产品和预订航班等任务。


与依赖预加载数据的现有 AI 工具不同,Jarvis 能够搜索网络并为用户提供检索实时数据的能力,从而绕过传统搜索引擎。简而言之,它基本上接管了 Chrome 网络浏览器来为用户执行任务。


报道指出,该工具的工作原理是截取计算机屏幕的屏幕截图,并“在执行单击按钮或输入文本字段等操作之前对截图进行解读”,这与微软此前备受争议的 Recall 功能非常相似,尽管后者用于存储和检索用户的计算机行为(目前微软宣称该项目将“稍后”亮相,且最初只开放给 Windows Insider 计划成员)。


Jarvis 的功能似乎是谷歌 Bard AI 的延伸,可以将自然语言理解与高级数据检索功能相结合。这种向实时数据响应的转变也代表着传统聊天机器人的最新发展方向。传统聊天机器人往往受到训练数据的限制,因此只能根据特定日期之前的信息回答问题。


报道还提到出,该工具目前的反应速度有些慢,“因为模型在采取每个动作之前需要思考几秒钟”。这表明,Jarvis 可能还没有准备好进入黄金时段。当时的消息称,谷歌计划在 12 月公开推出 Jarvis,同时推出的还有最新版本的 Gemini 大型语言模型。


现在,有熟悉谷歌内情的消息人士表示,Jarvis 本打算在对外发布之前进行内部试点测试。然而,此番意外泄露让不少人猜测谷歌恐怕会提前正式发布的时间。


AI 智能体操控屏幕的未来将至


上个月,当 Anthropic 推出名为“计算机使用 ”的新功能,基本上可以接管用户的计算机来读取和编写 JavaScript 代码时,我们的认知从 “《钢铁侠》只是一部电影 ”变成了 “这正在发生”。现在,谷歌的 Jarvis AI 智能体似乎要让 “钢铁侠 ”幻想成真了。


只不过,Claude 是为程序员量身定制的,用于操作软件应用程序,而 Jarvis 与之不同,据说它是基于浏览器的,可以想象它将面向更主流的受众市场。


据外媒报道,OpenAI 也在开发这类自主 AI 智能体。此次谷歌 Jarvis AI 意外泄露事件就发生在 OpenAI o1 模型泄露的几天之后,后者同样意外曝光了一款能够分析图像、访问网络搜索结果及数据分析等工具的新推理模型,可能很快就会发展出更多的自主网页浏览功能。


几天前的 OpenAI 伦敦开发者大会上,Sam Altman 在与 20VC 创始人 Harry Stebbings 的对谈中,就对 AI 智能体进行了这样的定义:能够接受长期任务,且在执行过程中几乎不需要监督。他举例说,“假设不是让 AI 智能体给一家餐厅打电话订餐,而是让它同时联系 300 家餐厅,找出哪家最适合或者有优惠。我认为更有意思的是那种像一位聪明的资深同事一样,能与你在项目中真正协作的智能体。”


在最近的一次 Reddit AMA 中,OpenAI 首席产品官 Kevin Weil 也暗示道,ChatGPT 将首先具备向用户发送消息的能力,而为用户执行任务将是他们 “2025 年的一大主题”。


微软团队上月低调开源的 OmniParser,在 Hugging Face 上迅速大受欢迎的同时,似乎也预示着 AI 智能体操控屏幕的未来。OmniParser 是一款解析和识别屏幕布局的 AI 工具,能够提取文本、按钮和图标等重要信息,还可以将这些元素转换成结构化的数据,精准理解用户意图,可以帮助开发者自主创建用于操控电脑或手机界面的智能体。


并且,OmniParser 并不局限于网络浏览器或移动应用程序等特定的环境,它的目标是成为任何支持视觉的 LLM 与从桌面到嵌入式屏幕等各种数字界面进行交互的工具。据悉,GPT-4V 在使用 OmniParser 输出后,图标的正确标记率从 70.5% 提升至 93.8%。


此外,Apple Intelligence 也承诺通过其“屏幕感知”功能实现同样的功能。它会观察用户的活动并将发现输入到系统当中,以便下次以智能方式代替用户执行这些任务。


结   语


对谷歌来说,提高工作效率和自动化某些琐碎的任务是其许多 AI 产品寻找杀手级用例的方向。谷歌也在 Workspace 应用程序中引入了生成式 AI 功能,包括谷歌 Docs(文档)、Gmail、Sheets(表格)和 Slides(幻灯片)。


而关于此次意外泄露的“内部预览版”Jarvis,近期已有不少类似可以通过简单命令来接管计算机的 AI 智能体出现在大众视线里。需要注意的是,随着这类 AI 驱动浏览变得愈发普遍,围绕数据透明度、访问私人内容和网络数据的道德使用引发的问题也可能进一步激化。


参考链接:


https://www.theinformation.com/briefings/google-accidentally-reveals-jarvis-ai-that-takes-over-computers


https://mashable.com/article/google-accidentally-leaked-new-ai-tool-browses-internet-for-you


https://www.tomsguide.com/ai/google-confirms-jarvis-ai-after-accidental-leak-heres-what-we-know


https://www.androidpolice.com/google-gemini-project-jarvis-ai-agent/


2024-11-11 14:354645

评论

发布
暂无评论
发现更多内容

Mac屏幕录像机:EaseUS RecExperts 可以添加水印或者字幕

Rose

rEvolution收购WePlay,增强实力并扩大全球影响力

财见

Cisco Secure Network Analytics 7.5.1 发布下载,新增功能概览

sysin

Cisco NDR

加速区块链游戏过渡到 Web3,一文读懂Zypher Network的Zytron引擎

石头财经

精通Java并发锁机制:24种锁技巧+业务锁匹配方案(第三部分)

肖哥弹架构

Java 高并发

多线程;顺序容器;智能指针

芯动大师

多线程 智能指针

CleanMyMac X 5 新功能介绍

Rose

欧洲与北美深科技人才大战升级

财见

德国新安装工业机器人数量创纪录

财见

一文读懂 Zypher Network Zytron 引擎:让链游从 Web2.5 过渡Web3

西柚子

智驭未来金融:哈银消金入选银行业典型案例,重塑金融服务生态

极客天地

Pencils Protocol 成市场新宠,生态通证$DAPP价值几何

加密眼界

Pencils Protocol 成 DeFi 赛道新宠 ,市场广泛看好$DAPP

BlockChain先知

Pencils Protocol 成市场新宠,生态通证$DAPP价值几何

石头财经

Flicker Free for mac(专业AE视频去闪烁插件) v1.1.8激活版

Rose

SecureCRT中文乱码的解决方法(附 SecureCRT mac激活安装包)

Rose

Syncron研究揭示了塑造售后服务未来的关键挑战和战略转变

财见

从“纸面算力”到“好用算力”,超聚变打通AI+“最后一公里”

Alter

万界星空科技机械加工行业MES系统功能介绍

万界星空科技

mes 万界星空科技mes 机械加工 机械加工mes

加速链游Web2.5过渡到 Web3,一文读懂 Zypher Network 的 Zytron 引擎

BlockChain先知

万界星空科技AI低代码平台:重塑数字化创新边界

万界星空科技

低代码 mes 万界星空科技mes 万界星空科技低代码平台

Pencils Protocol 成市场新宠,生态通证$DAPP价值几何

股市老人

“算力好用”:数字中国的新黄河

脑极体

AI

KeyShot 2024下载安装(含keyshot2024激活补丁)- mac&win

Rose

两场大会,数睿数据收到来自中国信通院的多项认可

财见

读书笔记:告别拖延症的行动指南

老张

读书笔记 认知提升 职场成长

谷歌版贾维斯意外泄露!自主上网购物填表不在话下,“钢铁侠 ”成真指日可待?_AI&大模型_华卫_InfoQ精选文章