|
查看: 106|回复: 50
|
[行业资讯]
AI Agent自主执行任务到哪了:从Manus到AutoGPT实测
[复制链接]
|

UID2
贡献9 点
钻石7 个
C币993 个
|
我这半个月都在折腾AI Agent,主要测了Manus、AutoGPT和一个开源的OpenManus。说实在的,进步很大但离"交给它就不用管"还差得远。
Manus跑了一个"帮我调研某公司并出报告"的任务,大概花了40分钟,中间自己开了浏览器搜了二十多个网页,最后确实出了个PDF。但仔细看内容,有三四处数据对不上,引用的财报数字明显是它自己编的。后来换了三个任务测,每次都有这种"看起来像但经不起查"的问题。

AutoGPT那边更糙,让它规划一个"上线一个小工具"的任务,它绕了半小时一直在写TODO列表和读README,没真正动手写过一行能跑的代码。反而是用GPT-4o加function calling手动搭的工作流,指定三四个工具给它调,执行成功率能到70%以上。
我的判断是:限定工具集加明确步骤拆分的Agent已经能用了,那种"给个目标自己想怎么做"的还差两年。别信demo视频,自己跑一遍就知道了。 |
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!
|
|
|
|
|
|
|
|
|
|

匿名
发表于 2026-9-17 18:32:16
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 18:37:21
|
显示全部楼层
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 18:44:28
|
显示全部楼层
|
关键还是数据质量,模型再强喂垃圾也是白搭。你们的延迟和成本大概什么水平? |
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 18:48:38
|
显示全部楼层
|
我比较看好垂直领域的做法,通用方案竞争太激烈。有对比过同类的其他方案吗? |
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 18:52:21
|
显示全部楼层
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 18:56:17
|
显示全部楼层
|
我拿它跑过类似任务,前几版效果一般,调完提示词才像样。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 18:58:16
|
显示全部楼层
|
有几个坑提醒下,接口一变整套流程都得跟着改,最好提前做抽象层。 |
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 19:01:32
|
显示全部楼层
|
|
|
|
|
|
|
|
|
|
发表于 2026-9-17 19:05:08
|
显示全部楼层
|
|
|
|
|
|
|
|
温馨提示:
1、在论坛里发表的文章仅代表作者本人的观点,与本网站立场无关。
2、论坛的所有内容都不保证其准确性,有效性,时间性。阅读本站内容因误导等因素而造成的损失本站不承担连带责任。
3、当政府机关依照法定程序要求披露信息时,论坛均得免责。
4、若因线路及非本站所能控制范围的故障导致暂停服务期间造成的一切不便与损失,论坛不负任何责任。
5、注册会员通过任何手段和方法针对论坛进行破坏,我们有权对其行为作出处理。并保留进一步追究其责任的权利。
6、网络世界也请遵守我国的法律法规!一旦发现违法行为,将立即封存相关信息并报警处理!