跳到正文

#Agent

今日 165 条
5月22日周五
5月20日周三
  1. Sierra:Blog(RSS)28

    Sierra 谈 Agent Strategist:应用 AI 时代的复合型新岗位

    Sierra 称 Agent Strategist 是其增长最快的团队,这一角色结合 go-to-market、咨询与构建能力,负责端到端落地 AI 智能体。该岗位借助其构建智能体的工具 Ghostwriter,将客户旅程转化为可运行智能体,并持续改写提示词、运行数百次模拟来调优。Sierra 按结果收费,仅在智能体交付实际成果时获得收入。

  2. Modem:Blog(RSS)36

    Modem 面向所有用户推出 Automation Templates 自动化模板

    Modem 向所有用户开放 Automation Templates,可在 Automations 页面浏览并一键安装经过测试的现成智能体自动化。安装后模板会生成预填提示词、调度和输出目标的自动化,未编辑提示词时还能随官方改进持续更新,用户也可随时 fork 自行定制。模板覆盖 GitHub PR 合并后通知 Slack、每日新面孔识别、每周更新日志草稿等场景。

5月19日周二
  1. Google DeepMind:Blog(RSS)46

    Google DeepMind Co-Scientist 加速细胞衰老逆转研究

    Google DeepMind 的 Co-Scientist 帮助 Omar Abudayyeh 和 Jonathan Gootenberg 实验室加速细胞衰老逆转研究:它扫描数万篇论文后提出 20 多个可测试的新遗传因子,其中数个经实验验证能驱动细胞进入更年轻状态并改善整体功能。Co-Scientist 还将原本需长达六个月的筛选数据分析缩短至几天。

5月18日周一
  1. Google DeepMind:Blog(RSS)13

    Google Antigravity 2.0 发布

    Google 发布智能体开发平台 Google Antigravity 2.0。该平台在 Google DeepMind 官网被列为面向开发者的 agentic development platform,与 Gemini 应用、Google AI Studio 并列于产品与工具入口。

5月17日周日
5月16日周六
  1. Google DeepMind:Blog(RSS)41

    Google Co-Scientist 加速肝病机制发现

    爱丁堡大学团队用 Google Co-Scientist 研究 MASH 肝病,系统整合肝脏生物学与药理学证据,提出将 NLRP3 炎症小体作为连接炎症与代谢的分子桥梁这一新假设,并经实验验证。该假设或为靶向联合疗法铺路,也解释了 resmetirom 为何仅对少数符合条件的患者有效。

  2. Google DeepMind:Blog(RSS)85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。

    推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。

5月14日周四
5月12日周二
  1. Google DeepMind:Blog(RSS)62

    Google DeepMind 发表 Co-Scientist 多智能体科学假设生成系统,并通过 Hypothesis Generation 开放研究者注册

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。

    推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。

  2. Lilian Weng39

    过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊

    引用Thinking Machines@thinkymachines

    People talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models

5月11日周一
  1. Import AI48

    Import AI 456:RSI 与经济增长、AI 监管的“激进可选性”与神经计算机

    Institute for Law & AI 提出“激进可选性”监管思路,主张政府短期避免过度监管,同时提前建设信息收集、举报人保护、评估与人才等制度工具,以应对 AI 可能带来的剧烈冲击。Meta 与 KAIST 的论文提出 Neural Computer,试图用神经网络在学习到的运行时状态中统一计算、内存与 I/O。

5月9日周六
5月8日周五
5月7日周四
  1. Sierra:Blog(RSS)30

    Sierra 如何评估它的 Monitors?

    Sierra 的 Monitors 是常驻评估层,用 LLM-as-judge 审查每一段对话,追踪智能体质量与客户情绪。每个 monitor 都经过基于团队标注对话和模型一致性的严格评估循环,模型分歧会被反馈进训练与评估集,直到稳定一致。Sierra 还通过 Agent Studio 让企业用自然语言创建自定义 monitor,并走同一套评估流程。

5月6日周三
5月5日周二
5月4日周一
5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

5月1日周五
4月30日周四
4月28日周二
  1. Fuli Luo65

    小米 MiMo 团队开源两款模型:MiMo-V2.5-Pro(Code Agent,总参数 1T)和 MiMo-V2.5(多模态 Agent,总参数 310B)。采用 MIT 许可证,支持商用部署、继续训练和微调,两款模型均支持 1M token 上下文窗口;官方称 MiMo-V2.5-Pro 在开源模型中 GDPVal-AA 和 ClawEval 排名第一。开发者还可申请 100T 免费 token(http://100t.xiaomimimo.com),权重在 Hugging Face 提供。

    引用Xiaomi MiMo@XiaomiMiMo

    Xiaomi MiMo-V2.5 is now officially open-sourced! MIT License, supporting commercial deployment, continued training, and fine-tuning - no additional authorization required. Two models, both supporting a 1M-token context window : • MiMo-V2.5-Pro: built for complex agent and coding tasks, ranking No.1 among open-source models on GDPVal-AA and ClawEval • MiMo-V2.5: a native omni-modal model with strong agent capabilities A model's value isn't measured by rankings alone — it's measured by the problems it solves. Let's build with MiMo now! 🤗 Weights: https://huggingface.co/collections/XiaomiMiMo/mimo-v25 📄 Blog: https://mimo.xiaomi.com/index#blog

4月27日周一
4月24日周五
4月23日周四