跳到正文

#Agent

今日 190 条
9月24日周四
  1. elsewhere:文章(RSS)49

    元宝上线旅游计划 Agent:从微信聊天到行程卡、装备清单一站搞定

    腾讯元宝节前更新旅游计划能力,在 APP 对话中切换专家模式即可触发旅游计划 Agent,支持把微信聊天记录转发进来整理需求。它会实时查询门票预约规则等信息,输出可交互行程卡与行程图,行程图由混元 Hy Image3.5 preview 生成,还能推荐徒步装备并跳转京东小程序加购。

  2. eric zakariasson41

    智能体在工作前后喜欢大量读取以收集上下文,所以针对读取做优化会带来很大差别! 如果你在构建智能体,我强烈推荐读一读这个(或者把它交给你的智能体,让它去实现这些发现)

    引用Cursor@cursor_ai

    We've reduced token costs in Cursor by 7% with no drop in agent quality. Savings came from tighter prompts, selective tool loading, better caching, and compressed file reads.

  3. a16z:News(RSS)26

    a16z 推出 Ops Engineering Fellowship,六周培养 AI 运营工程人才

    a16z 推出 Ops Engineering Fellowship,面向用 AI 重塑组织运作方式的跨职能建设者,为期六周,2026 年 10 月启动。该项目提供旧金山线下晚宴系列,参与者包括 Ramp、Stripe、Decagon 等公司的内部 AI 负责人。a16z 认为运营已成为工程问题,招募对象是构建或部署跨职能 AI 智能体、把 AI 从个人工具变成组织基础设施的人。

  4. SiliconFlow42

    并非每次模型调用都需要一个答案。有时,它只需要一个决策。 👏 欢迎 Kev-4B 加入 SiliconFlow。 Kev-4B 是 Jev 的开源社区版,基于 Qwen3.5-4B 构建,用于结构化决策。 路由。排序。批准。升级——无需再生成一段回复。 无需部署或适配。一个 SiliconFlow API key,Kev 即可接入你的工作流。 特别感谢 @jaredpalmer 开源 Kev。❤️ 在 SiliconFlow 上试用 Kev-4B。⚡️

  5. Google DeepMind:Blog(RSS)60

    Google DeepMind 为 Private AI Compute 引入安全服务端持久记忆

    Google DeepMind 公布 Private AI Compute 架构更新,将持久化的服务端记忆引入该平台,使 AI 助手能跨设备保留上下文。数据被密封在加密存储中,解锁密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。

    推荐理由:Google 公开了 Private AI Compute 的持久化服务端记忆方案,读者可了解云端记忆如何在设备持钥前提下实现。

9月23日周三
  1. elsewhere:文章(RSS)72

    大模型的斩杀线斩的是谁:从小米 MiMo-V2.6 看智能成本前沿的位移

    十字路口Crossing 发文分析大模型的「斩杀线」现象,即模型在智能和成本两个维度同时被超越后失去被选择的理由。9 月 22 日小米发布并开源 MiMo-V2.6 系列三款模型,智能水平接近前代两倍而价格不变,与同日发布的 Grok 4.7 智能指数持平但单项任务成本仅 0.13 美元,约为后者的 1/21 到 1/29。

  2. elsewhere:文章(RSS)50

    千问办公发布「企业上下文」与 QwenNote A2,要把企业内部连接起来

    千问办公发布「企业上下文」,把群聊、文档、知识库等分散信息整理成结构化上下文,供 Agent 提取任务所需信息,思路是「连接与压缩」。同时推出由钉钉 A1 升级而来的 QwenNote A2 录音卡,默认不录音、云端 ASR 转写后永久删除音频,并上线多人协作功能。企业上下文依赖新模型 Qwen3.8-Omni-Flash,千问办公此前已与模型团队定制 Qwen 3.8 Flash。

  3. Latent Space(RSS)84

    Claude Opus 5.5 发布成新默认模型,OpenAI 同日推 GPT-6 Sol 和 Luna 降价应战

    AINews 汇总:Anthropic 发布 Claude Opus 5.5,称多数任务达 Fable 5.1 水平、比 Opus 5 便宜 40% 且快 30%,成为 Claude Code 和应用新默认模型;OpenAI 数小时后推出 GPT-6 Sol($2/$10)和 Luna($0.10/$0.50),价格比 GPT-5.6 前代低约 50%。

    推荐理由:除了两家降价发布,原文还汇总了缓存定价拆解、effort 异常和第三方评测口径问题,提供了单一官方稿之外的交叉信息。

  4. Gary Marcus:The Road to AI We Can Trust(RSS)53

    Gary Marcus 回顾 Facebook M 失败史,质疑 Meta Muse 能否走出老路

    Gary Marcus 撰文对比 Meta 新智能体 Muse 与 Facebook 2015 年的 Project M,指出两者都瞄准餐厅预订、戏票等任务。Project M 因运行成本高只开放给约 1 万用户,后被曝幕后有人工代答,2018 年 1 月被取消,AI 实际处理的请求不超过 30%;Marcus 认为 Zuckerberg 正在重复当年的错误,并质疑其对隐私的态度。

  5. eric zakariasson38

    我记得大约 1.5 年前我们刚做出这个东西的第一个粗糙版本,只是为了应对疯狂的量级 当时学到的道理现在依然成立:先爬,再走,后跑。找到能持续改进的飞轮。让它一直跑下去(适用于很多事情) 团队干得漂亮!

    引用Grok Bot@bot

    We rebuilt customer support around Grok Bot to scale our operations without adding headcount. It works autonomously to respond to customers, resolve tickets, and manage the queue. https://x.ai/news/grok-bot-customer-support

  6. StepFun55

    阶跃星辰(StepFun)宣布开源内部使用的 LLM 数据标注与模型检查工具 onPanda,工作流为找到错误、修正 token、让模型继续生成。数据标注方面,标注时间中位数比人工后编辑降低 52%,SFT 与偏好数据可在同一流程完成(ΔPPL <1%),支持 token 级正负样本监督及图像、音频、视频上的 agent 轨迹标注。

    引用Lei Yang@diyerxx

    I spent two years building this interactive tool to let you steer LLMs and agents at the token level. Introducing onPanda — a web app for token visualization & control, model inspection, data annotation, and more. Try it online (works on mobile): https://onpanda.diyer22.com/

  7. Andrew Milich50

    Andrew Milich 宣布可以在 Tesla 内与 @bot 对话,点咖啡、管理日程,甚至预订旅行。其引用的 Tesla 内容提到,车内的 Grok 现在可通过 Connectors 免提管理收件箱、清理日历,或梳理现有文件、聊天和任务。

    引用Tesla@Tesla

    .@Grok in your Tesla can now do meaningful work for you With Connectors, you can manage your inbox, clean up your calendar, or talk through existing files/chat/tasks – all hands-free