QCon 演讲火热征集中,快来分享技术实践与洞见! 了解详情
写点什么

智谱发布自主 Agent 全家桶,目标:让打工人实现“光说不干”!

  • 2024-11-29
    北京
  • 本文字数:1790 字

    阅读完需:约 6 分钟

大小:891.68K时长:05:04
智谱发布自主Agent全家桶,目标:让打工人实现“光说不干”!

整理 |华卫

 

“来自 AI 的微信红包已派发,请查收!”

 

在今天的智谱 OpenDay 现场,智谱 CEO 张鹏只向 AutoGLM 下达了一个简单语音指令,就成功执行了这个操作。

 

现场,智谱带来了多个通过 Agent 操作手机、电脑,甚至手机电脑联动的新进展:

  • AutoGLM 可以自主执行超过 50 步的长步骤操作,也可以跨 app 执行任务

  • AutoGLM 开启“全自动”上网新体验,支持等数十个网站的无人驾驶

  • 像人一样操作计算机的 GLM-PC 启动内测,基于视觉多模态模型实现通用 Agent 的技术探索

 

此外,张鹏还展示了通过手机给 GLM-PC 发消息,让 GLM-PC 自动进行发送文件等电脑操作的过程。据介绍,GLM-PC 还可以在开机状态下执行定时任务,比如定时发日报等。

 

原本对于机器而言非常复杂的操作,现在可以由智谱产品化的 Agent 完成,大模型正在从只有对话功能的 Chatbot 走向能够进行实际物理操作的自主 Agent。张鹏表示,“Agent 将极大地提升 L3 使用工具能力,同时开启对 L4 自我学习能力的探索。”

 

AutoGLM 新升级:挑战更复杂

 

在张鹏看来,Agent 可以看作是大模型通用操作系统 LLM-OS 的雏形。

 

“现阶段,AutoGLM 相当于在人与应用之间添加一个执行的调度层,很大程度上改变人机的交互形式。更重要的是,我们看到了 LLM-OS 的可能,基于大模型智能能力(从 L1 到 L4 乃至更高),未来有机会实现原生的人机交互。将人机交互范式带向新的阶段。”

 

据张鹏介绍,新升级的 AutoGLM 可以挑战完成以下复杂任务:

 

1. 超长任务:理解超长指令,执行超长任务。例如,在采购火锅食材的例子中,AutoGLM 自主执行了 54 步无打断操作。并且,在这种多步、循环任务中,AutoGLM 的速度表现超过人手动操作。

2. 跨 app :AutoGLM 支持跨 App 来执行任务。用户可以习惯于 AI 自动处理,而不是在多个 APP 间来回切换。由于目前 AutoGLM 形态更像是用户和应用间的 APP 执行的调度层,因此跨 App 能力是里面非常关键的一步。

3. 短口令:AutoGLM 能够支持长任务的自定义短语。

4. 随便模式:AutoGLM 可以主动帮用户做出决策,带来抽盲盒式的惊喜。

 

支持核心场景和核心应用的 AutoGLM 标品 API,会在两周内上线到智谱 maas 开放平台(bigmodel.cn)试用。同时,AutoGLM 启动大规模内测,并将尽快上线成为面向 C 端用户的产品。(autoglm-安卓:https://agent.aminer.cn/

 

Web 端也将开启“全自动”上网新体验,即日起智谱清言插件上线 AutoGLM 功能,支持搜索、微博、知乎、Github 等数十个网站的“无人驾驶”。(清言插件:https://new-front.chatglm.cn/webagent/landing/index.html?channel=ads_news_openday

 

GLM-PC :面向“无人驾驶”PC 的技术探索

 

不只是基于手机和浏览器,智谱还带来了基于 PC 的自主 Agent。

 

据其介绍,GLM-PC 的技术路线是一种拟人的多模态的感知,基于智谱自研的 UI Agent 视觉基座模型 CogAgent。模型仅需视觉截图作为输入,无需依赖 HTML 等语言表征,可应用至任意图形用户界面,具备极强的跨平台、跨系统泛化能力。

 

glm-pc:https://www.wjx.top/vm/mOs9cHw.aspx

 

简单来说,GLM-PC 用电脑的方式几乎完全和人一样。人在电脑上办公的过程是,用眼看图形、图像、文字,然后用脑规划,再用手执行单击双击、滚动、输入、悬浮等操作。GLM-PC 同样也是把用电脑的动作拆解如上,最终准确输出具体动作(精确至坐标)。

 

也正因如此,理论上只要是为人类设计的应用,在 GLM-PC 学习之后它都能够执行。这是一种系统级、跨平台的能力,不依赖于 HTML、API,而且具备更高的能力上限。

 

目前开放第一阶段的内测场景,包括:

1. 会议替身:帮用户预定和参与会议,发送会议总结。

2. 文档处理:支持文档下载、文档发送、理解和总结文档。

3. 网页搜索与总结:在指定平台(如微信公众号、知乎、小红书等)搜索指定关键词,完成阅读、总结。

4. 远程和定时操作:远程手机发指令,GLM-PC 可以自主完成电脑操作;设定一个未来时间,在开机状态下定时执行任务。

5. 隐形屏幕:在用户工作时,GLM-PC 可以在隐形屏幕上自主完成工作,解放屏幕使用权。

 

不过,GLM-PC 在当前版本下,用户仍需要输入非常精准的指令。张鹏解释道,由于 PC 的复杂程度,以及大家在 PC 完成的几乎都是复杂任务,今天大模型的能力距离真正代替办公还有一定距离。

 

但张鹏表示,未来 GLM 团队将继续加速 Agent 模型产品的研发,期待着一句话操作电脑和手机的范式尽快到来。到那时,Agent 或许真有望帮助打工人实现“光说不干”的一天。

 

2024-11-29 23:249901

评论

发布
暂无评论
发现更多内容

游泳馆应用软件开发:在线一站式服务,优化用户整体体验

开源直播系统源码

软件开发 APP开发 直播系统

java培训如何让SpringBoot支持Jsp

@零度

JAVA开发 spring-boot

全国超10亿用户!AntDB数据库的电信核心交易替换之路

亚信AntDB数据库

数据库 通信 电信 运营商 数据库应用开发

国际权威报告:SaaS+AI大势所趋,腾讯云领跑国内科技公司

科技热闻

腾讯云小微技术登顶权威榜单XTREME基准,跨语言技术迁移开发助力企业出海

科技热闻

蜜月期过后,跨境电商的出口在哪里?亚马逊云科技全新洞察发布

Lily

“躺着都能赚钱”的时代已经过去,亚马逊云科技为跨境电商找到下一个爆点

Lily

Java—线程

武师叔

6月月更

从无到有,政务系统的全面可观测模板

博睿数据

智能运维 博睿数据 政务系统 全面检测

在线帮助中心对企业的作用及解决方案

小炮

改变世界的开发者丨黑客松冠军,为听障儿童推开一扇“有声的窗”

华为云开发者联盟

云计算 华为云 GaussDB 听觉 听障儿童

【LeetCode】高度检查器Java题解

Albert

LeetCode 6月月更

实战 | SpringBoot+MySQL事务/行级锁实现商品减库存

写程序的小王叔叔

微服务 事务 MySQL 数据库 6月月更 事务/行级锁

面试突击56:聚簇索引和非聚簇索引有什么区别?

王磊

Java MySQL 面试

全球云计算市场持续发力,但云身份管理能力认可度不足3成

行云管家

云计算 云服务 企业上云 混合云 多云

【真相】大厂招人不怕花钱的原因竟然是。。。

博文视点Broadview

本地开发测试,局域网中使用IP地址访问项目网站

迷彩

网站架构 学习记录 网站开发 6月月更

ShardingSphere 异构迁移最佳实践:将3.5亿量级的顾客系统 RTO 减少60倍

SphereEx

Java php MySQL 数据库 ​Apache ShardingSphere

Mybatis省略@Param注解原理

mybatis 6月月更 @Param注解

fitfi运动赚钱链游系统开发模式详情

开发微hkkf5566

《正面管教》:如何科学地管教孩子?

郭明

读书笔记

本周二晚19:00战码先锋第5期直播丨深入理解OpenHarmony系统启动,轻松踏上设备软件开发之旅

OpenHarmony开发者

OpenHarmony

Wallys/Network_Card/DR-NAS26/AR9223/2x2 MIMO

wallys-wifi6

【网络安全】VPN是什么?VPN与堡垒机有啥区别?

行云管家

网络安全 堡垒机 vpn

蓝凌叮当刘向华:如何用一款SaaS俘获年轻人的心?

ToB行业头条

如何实现十亿级离线 CSV 导入 Nebula Graph

NebulaGraph

知识图谱 数据导入 Nebula Graph CSV 文件导入

想发自己的NFT,你要先搞清楚这6个问题

华为云开发者联盟

区块链 数据资产 NFT

秒云与趋动科技联合发布容器云平台与GPU资源池化整体解决方案

MIAOYUN

人工智能 容器 云原生 容器化 容器云平台

致力超表面光子芯片产品研发与制造,山河光电完成数千万元Pre-A轮融资

硬科技星球

山河光电

产品故事|你所不知道的语雀画板

编辑器 思维导图 SaaS 企业知识管理工具

PostgreSQL精品学习资源合集(含基础手册、实操技巧&案例、书籍推荐)

墨天轮

数据库 postgresql

智谱发布自主Agent全家桶,目标:让打工人实现“光说不干”!_生成式 AI_华卫_InfoQ精选文章