游乐游手机版
首页/AI热点日报/热点详情

OpenAI发布Agent工具包 网友感谢Manus AI

类型:热点整理2026-07-03
刚刚,OpenAI 放出了一套专门为构建 AI Agents 设计的新工具和 API,目标很明确——让开发者更容易创建那些能自动完成复杂任务的智能体。过去一年,高级推理、多模态交互这些模型能力确实为 Agent 打下了基础,但真要把 Agent 用到生产环境里,开发者还是会碰到不少棘手的问题。这次发
刚刚,OpenAI 放出了一套专门为构建 AI Agents 设计的新工具和 API,目标很明确——让开发者更容易创建那些能自动完成复杂任务的智能体。过去一年,高级推理、多模态交互这些模型能力确实为 Agent 打下了基础,但真要把 Agent 用到生产环境里,开发者还是会碰到不少棘手的问题。这次发布的 Responses API、三种内置工具,再加上一个开源的 Agents SDK,算是直击痛点。 简单来说,核心亮点有几个: - **Responses API**:把 Chat Completions API 的简洁性和 Assistants API 的工具调用能力融合到一起,成为构建 Agent 的新基础。开发者只需一次 API 调用,就能让模型调用多种工具、进行多轮交互,搞定复杂任务。 - **Web 搜索工具**:让 GPT-4o 和 GPT-4o-mini 能直接联网获取最新信息,并给出清晰的引用来源。在 SimpleQA 基准测试中,这两个模型的搜索预览版分别拿下了 90% 和 88% 的准确率,相当亮眼。 - **文件搜索工具**:大幅度升级,支持多种文件格式,能优化查询、过滤元数据、自定义排序,帮开发者从堆积如山的文档里快速捞出关键信息。 - **计算机使用工具**:背后是 Computer-Using Agent (CUA) 模型,和 Operator 同款。它能捕获模型生成的鼠标和键盘操作,像真人一样操作电脑界面。在 OSWorld、WebArena 和 WebVoyager 测试中,分别取得了 38.1%、58.1% 和 87% 的成绩。 - **Agents SDK**:基于去年实验性的 Swarm 框架升级而来,开源且专门简化多 Agent 工作流的编排。提供易于配置的 LLM 与内置工具集成、Agent 间智能交接、安全检查以及可视化追踪,适合客户支持自动化、多步研究、内容生成等场景。 已经有早期测试用户用这些工具做出了实打实的成果。Hebbia 利用 Web 搜索工具帮资产管理者和法律从业者从海量数据里提取可执行的见解;Na van 把文件搜索工具集成到 AI 旅行 Agent 中,给用户提供精准的旅行政策答案;Unify 和 Luminai 则用计算机使用工具自动处理那些缺乏 API 的传统系统的复杂操作流程;Box 借助 Agents SDK 快速构建并部署了企业数据搜索应用。 产品发布后,网友在评论区玩起了梗,还有人专门留言感谢 Manus AI。 在今天凌晨的现场直播中,演示团队用了一个“个人造型师”Agent 的应用案例,把这些新工具的本事展示得淋漓尽致。他们先用文件搜索工具翻阅了用户(比如“Elon”和“Kevin”)的服装喜好数据,轻松掌握了每个人的穿衣风格。接着调用 Web 搜索工具,基于 Kevin 的位置(演示中用东京为例),搜索附近的相关商店,给 Kevin 推荐了东京的 Patagonia 店铺。 然后计算机使用工具登场——自动操作网页界面,为 Kevin 下单一件黑色 Patagonia 夹克。点击、拖拽、填信息,整个过程行云流水,跟真人在操作没什么两样。最后还演示了 Agent 之间的交接功能:销售 Agent 把退货请求无缝转给客服 Agent,后者调用获取密码和提交退款请求等功能,帮助用户完成退货。可以说,凭借新工具和 API 的默契配合,这些 AI Agent 不仅能读懂用户喜好、获取实时资讯、执行复杂操作,还能在不同任务间灵活切换,覆盖了从推荐到购买再到退货的全流程。 至于现有 API 的安排,OpenAI 明确表示会继续全力支持 Chat Completions API,为不需要内置工具的开发者提供新模型和功能。而基于 Assistants API 测试版的反馈,他们已经把关键改进整合到了 Responses API 中,计划在功能对齐后,于 2026 年中期正式停用 Assistants API,届时会提供详细的迁移指南。 新工具的定价也放出来了:Web 搜索每千次查询,GPT-4o 搜索 30 美元,GPT-4o-mini 搜索 25 美元;文件搜索每千次查询 2.5 美元,文件存储 0.1 美元/GB/天(首 GB 免费);计算机使用工具则按每输入百万 token 3 美元、每输出百万 token 12 美元计费。 英伟达 CEO 黄仁勋曾预言,未来每个公司的 IT 部门都会变成 AI Agent 的“HR 部门”——从管人变成管 AI。Agent 很快就会成为劳动力的重要组成部分,提升各行业的生产力。这次发布的新工具集,正是帮助开发者和企业构建、部署、扩展可靠高效 AI Agent 的关键一步。以前开发者得自己组合不同 API、写复杂的协调逻辑来构建 Agent,现在 Responses API 把多种功能整合成一个简单接口,内置工具给 AI 提供了“感知”和“行动”的能力,Agents SDK 则给出了协调多 Agent 的标准框架。技术门槛降低了,更多企业能快速上手。 这可能就是 OpenAI 所说的“Agent 元年”的真正含义——让 AI 不再困在聊天框里,而是融入现实工作流程,成为你的“数字助理”甚至“数字同事”。 附上 AMA 问答的精选内容: **Q:哪种操作系统最适合 computer use?Linux、Mac 还是 Windows?是图形界面还是终端更好?哪些应用程序表现最佳?** A:CUA 模型主要是针对网页任务训练的,但早期用户发现它在桌面应用程序上的表现也出乎意料地好。不过现在还处在早期阶段,还有很多可以改进的地方。 **Q:你们会提供 TypeScript SDK 吗?** A:很快会推出。 **Q:未来会在 API 中看到 o1 pro 吗?** A:计划很快在 responses API 中发布。 **Q:需要自行管理 Docker 环境来使用计算机功能吗?** A:可以自行管理 Docker 环境,也可以使用云服务。 **Q:何时会有 Operator 在 API 中可用?** A:从今天开始,你可以在 API 中使用与 Operator 相同的功能!我们已经在新的 Responses API 中部署了驱动 Operator 的 CUA 模型。 **Q:会考虑提供集成的虚拟机来支持 computer use,或者与合作伙伴合作以减少搭建环境的需求吗?** A:目前还没有这样的计划,但可以查看 CUA 示例应用,其中包含一些示例环境用于远程托管。 **Q:在 agent-handoff 流程中,如何确保个人隐私?有没有什么方法增强用户与 Agent 交互时的隐私保护?** A:有多种隐私保护机制。Agents SDK 支持开发者定义的安全措施(guardrails),用于输入/输出验证,还可以使用 input_filter 来限制在交接过程中传递的消息上下文。
来源:https://www.53ai.com/news/OpenSourceLLM/2025031283974.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。