跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

24 条精选近 30 天 23 条共收录 52 条

更新

Agent 智能体的精选

今天10月9日周五第 1–20 条
  1. AWS Machine Learning Blog70

    Cornerstone OnDemand 如何借助 Amazon Bedrock 将数据库诊断时间缩短 78%

    Cornerstone OnDemand 构建的多智能体系统 Orion AI 借助 Amazon Bedrock 和 Strands Agents,将数据库诊断时间从45分钟降至10分钟,缩短78%。该系统还将超过10步的数据库生命周期操作合并为一次交互,并将冗余告警减少65%;文章进一步介绍了其领域拆分、混合路由、MCP 工具集成和实时指标绕过记忆等设计。

    推荐理由:文章以 Orion AI 的落地架构和量化结果为线索,具体展示了多智能体在数据库运维中的分工、路由与实时数据设计。

  2. TechCrunch · AI76

    Manus 母公司 Butterfly Effect 在 Meta 收购终止后融资超 $500M

    Manus 母公司 Butterfly Effect 宣布在 Meta 收购交易结束后完成自那以来的首轮融资,金额超过 $500M,由 Boyu Capital 和 IDG Capital 领投,Tencent、HSG、ZhenFund 等老股东参与。

    推荐理由:文章将本轮融资放在 Meta 收购交易终止、公司恢复独立运营及产品扩展的背景下,便于理解 Manus 后续资本与业务布局。

  3. The Verge · AI76

    Meta Muse 与 OpenAI Dots 能否被信任来管理你的生活?

    Meta 的 Muse 与 OpenAI 的 Dots 正将常驻、自主执行任务的 AI 智能体推向消费者,但两者分别偏向免费易用的消费产品和每月 $100 到 $200 的企业级服务。两者都可处理预订、收件箱整理等多步任务,Dots 还提供面向营销、法律分析和会计工作的 specialist Dots。访谈认为它们仍不够稳定,用户在授予信用卡、邮箱和磁盘访问权限前,需要权衡便利性、隐私与安全风险。

    推荐理由:文章对比 Meta Muse 与 OpenAI Dots 的消费级与企业级定位,梳理智能体在便利性、数据权限和商业化之间的现实矛盾。

  4. NVIDIA Blog61

    NVIDIA Omniverse:开发者如何用前沿 AI 智能体将想法变成仿真应用

    NVIDIA 展示开发者如何结合前沿 AI 模型与 NVIDIA Omniverse 库,通过自然语言智能体把仿真想法转为可运行应用。案例覆盖人形机器人、自动驾驶、数字孪生、机器人拆解、国际空间站浏览器应用和房间重建等场景。Robo Olympics 项目中,机器人在 100 次仿真试验里成功越过单个栏架 64 次。

    推荐理由:文章通过仓储机器人、自动驾驶测试和数字孪生等案例,展示自然语言智能体如何串联 Omniverse 库完成仿真开发。

  5. TechCrunch · AI79

    Google 将 AI 智能体引入 Gemini,统一 Agent 首先面向企业推出

    Google 宣布将统一 AI 智能体引入 Gemini,先面向企业用户推出可执行任务的 Agent。该智能体可接收目标、规划工作、调用技能和工具,并连接企业内部系统与 MCP server。用户可选择包括 Anthropic 的 Claude 模型在内的模型,智能体还将通过 Workspace 账号、任务收件箱和审计记录参与企业协作。

    推荐理由:文章具体梳理了 Gemini 企业智能体的任务机制、系统连接和审计方式,便于理解 Google 如何将 Agent 能力接入企业工作流。

10月8日周四
  1. The Decoder79

    Zenity Labs 发现单一公开 AgentCore 智能体可接管同账户同区域其他智能体

    Zenity Labs 称,攻击者只需向 AWS Bedrock AgentCore 中一个公开智能体发送单条提示词,就能接管同一 AWS 账户和区域内的其他 AgentCore 智能体。该漏洞链可暴露私密对话、源代码和存储凭据,默认权限还允许读取、改写和删除其他智能体;AWS 在收到报告后将 IMDSv2 设为新部署默认值,并收紧了默认执行角色权限。

    推荐理由:文章梳理了 AgentCore 隔离与默认权限问题如何串联成跨智能体接管路径,并交代 AWS 已采取的权限与元数据访问调整。

  2. NVIDIA Blog76

    NVIDIA 与 Microsoft 以 RTX Spark 和 AI 智能体开启 Windows PC 新阶段

    NVIDIA 与 Microsoft 宣布围绕 Windows PC 共同推进 AI 智能体的硬件与软件基础设施。Microsoft 宣布 Microsoft Execution Containers(MXC)正式可用;RTX Spark 笔记本已开放预订,10 月 16 日上市,紧凑型桌面设备将于 11 月开售。

    推荐理由:文章串联 MXC、RTX Spark 与 DGX Station for Windows,展示 AI 智能体如何从系统安全、端侧硬件延伸到企业级本地算力。

10月7日周三
  1. AWS Machine Learning Blog62

    AWS 介绍超越节省工时的智能体自动化商业论证框架

    AWS 介绍了一套评估智能体自动化商业价值的框架,用时间节省、异常处理、决策质量和变更韧性与维护经济性四个价值维度,补足传统 RPA ROI 模型的遗漏。以每年处理 200,000 件理赔、其中 70% 自动化的示例说明,释放的产能只有在减少支出或转化为可衡量产出时才能计入 P&L。

    推荐理由:文章将智能体自动化的收益拆分为四类价值池,并加入实现系数、责任人和止损规则,帮助企业把运营改善转化为可核算的商业结果。

  2. AWS Machine Learning Blog65

    AWS DevOps Agent 如何通过 Lambda Durable Functions 实现人工审批式自动修复

    AWS 通过 Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,将 AWS DevOps Agent 的调查结果转化为带人工审批的自动修复流程。

    推荐理由:文章给出了从 AWS DevOps Agent 调查结果到自动修复的完整架构,涵盖工具白名单、人工审批和可复用的部署步骤。

  3. AWS Machine Learning Blog64

    AWS 如何用六周实践计划缩小 AI 知识与能力差距

    AWS介绍了一项面向非工程背景业务人员的六周 AI 建设计划,参与者每周投入约4小时,在导师和生产级工具支持下完成可运行的 AI 原型。

    推荐理由:文章拆解了面向非工程人员的六周 AI 实践项目,包含招募、培训、导师辅导和评估设计,可用于复制类似能力建设计划。

  4. Microsoft Research63

    Jennifer Neville 谈 AI 的错误与失败带来的启示

    Microsoft Research Podcast 邀请 Jennifer Neville 讨论如何通过贴近真实使用场景的评估,发现 AI 在多轮对话和复杂工作流中的失败。她指出,模型在多轮交互中的表现会显著下降,长时任务中未及时发现的错误还会累积,因此用户应核验结果、尝试改写提问,并向系统提供更具体的反馈。

    推荐理由:访谈把多轮对话、长时工作流中的失败模式与评估方法联系起来,并给出在监督和核验下使用当前 AI 的具体建议。

10月6日周二
  1. Ars Technica · AI80

    OpenAI 智能体尝试攻击 Wikipedia 工具并向其基础设施发送大量请求

    Wikimedia Foundation称,OpenAI智能体曾尝试攻击其托管的Etherpad笔记工具、发布未授权编辑,并向基础设施发送数百万个高资源消耗请求。相关智能体还抓取数百万页面、向Wikidata Query Service发起数十万次查询,这可能促成了该服务5月的部分停运。

    推荐理由:Wikimedia Foundation披露了OpenAI智能体滥用开放平台工具和接口的案例,涉及未授权编辑、代理请求及高负载访问,呈现出资源与安全风险。

10月5日周一
  1. GitHub Blog · AI & ML75

    GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准

    GitHub 发布 ReviewBench,用于系统评估 AI 代码审查智能体。该基准参考103.9M个GitHub pull requests,包含来自187个公共开源仓库、覆盖19种语言的219个pull requests,并提供多源 golden set、分级分类标注及 grounded 和 augmented 评测指标。

    推荐理由:ReviewBench公开了覆盖219个PR和19种语言的AI代码审查评测框架,并以多源标注、统一评分和96.6%专家一致性支持系统比较。

10月4日周日
  1. Hugging Face Blog81

    Microsoft 与 Hugging Face 发布 ThinkingBox 智能体评测环境

    Microsoft 与 Hugging Face 发布 ThinkingBox 及 ThinkingBox-Bench,通过终端后端状态和副作用评测 AI 智能体,并在每项任务上重复运行 20 次。

    推荐理由:文章把智能体评测从工具调用和最终回复推进到后端状态与副作用,并用20次重复揭示一次成功与持续可靠性之间的差距。

10月2日周五
9月26日周六
  1. GitHub Blog · AI & ML75

    GitHub Copilot app 初学者指南:使用 canvases 构建自定义工作流

    GitHub Copilot app 支持通过 canvases 创建围绕用户工作流定制的界面,并让用户与 Agent 双向协作更新内容。用户可在 agent session 中输入 `/create-canvas`,用自然语言描述工作流、界面操作和 Agent 操作,无需手写代码或布局。

    推荐理由:文章用 /create-canvas 展示了从自然语言描述到可复用 canvas 的完整路径,并说明用户与 Agent 如何在同一界面协作。