跳到正文

全部动态

今日 563 条
9月30日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程博客详解 AI 智能体的有效上下文工程方法

    Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。

    推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    Anthropic 详解 Agent Skills:用文件夹式的渐进式披露为 Claude 装载领域能力

    Anthropic 发布 Agent Skills 工程解析,说明 Skills 是包含 SKILL.md 的目录,通过渐进式披露分三级加载指令、脚本和资源,可附 Python 脚本作为可执行工具。Skills 已支持 Claude.ai、Claude Code、Claude Agent SDK 和开发者平台,文末给出编写、评估与安全审计建议,并提示恶意 Skills 可能引入漏洞或数据外泄风险。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 为 Claude Code 推出沙箱功能并开源沙箱运行时

    Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。

    推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)69

    Anthropic 工程博客:用代码执行提升 MCP Agent 的上下文效率

    Anthropic 发布工程文章,提出让 Agent 通过代码执行方式与 MCP 服务器交互,以解决工具定义和中间结果占用过多上下文的问题。示例场景中 token 消耗从 150,000 降至 2,000,节省 98.7%。文章还介绍了渐进式工具发现、在执行环境中过滤数据、PII 令牌化保护隐私、状态持久化与可复用 Skills 等收益,并提示需要沙箱、资源限制等安全基础设施作为权衡。

  5. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)79

    Anthropic 在 Claude 开发者平台推出 Tool Search Tool、Programmatic Tool Calling 和 Tool Use Examples

    Anthropic 在 Claude 开发者平台发布三项 beta 功能:Tool Search Tool 按需发现工具、Programmatic Tool Calling 用代码编排工具调用、Tool Use Examples 在工具定义中提供示例。

    推荐理由:官方给出了三项工具调用新功能的机制说明和内部测试数字,读者可以据此评估大工具库场景下的上下文与准确性权衡。

  6. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    Anthropic 工程博客详解 AI Agent 评测:评测器类型、任务设计与从零到一的建设路线

    Anthropic 工程博客发布长文,系统讲解如何为 AI Agent 构建可靠的自动化评测。文章定义了任务、试验、grader、transcript、评测框架等核心概念,对比代码型、模型型和人工三类评测器的优劣,分别给出编码、对话、研究和计算机使用四类 Agent 的评测方法,并解释 pass@k 与 pass^k 两种指标在非确定性下的差异。

  7. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程师复盘如何设计抗 AI 的技术评测

    Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。

    推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。

  8. arXiv:cs.AI(全量分类)39

    SafeCoEvo:面向 LLM 智能体的测试时安全框架与守卫协同演化

    SafeCoEvo 是一个面向 LLM 智能体的测试时 Harness-Guard 协同演化框架,让外部安全系统仅凭过往任务积累的运行经验持续适配未来未见任务。它通过 S-Harness 将近期运行经验快速外化为可更新的显式安全知识,并用 GuardVPO 在更长时间尺度上把安全经验内化为参数化风险判断能力。相比最强基线,不安全结果率降低 10.05%,任务成功率提升 12.15%。

  9. arXiv:cs.AI(全量分类)44

    AdaLCPI:智能体能否从碎片中重建间接提示词注入?

    研究者提出自适应长上下文提示词注入 AdaLCPI,将攻击目标拆成不完整碎片嵌入智能体工具检索到的外部内容,并用重建线索诱导智能体自行拼接,再借助 OpenEvolve 结合分级评分与目标智能体的自然语言执行反馈迭代优化碎片和线索。实验显示其宏平均 ASR 达 61.4%,高于 Trojan Hippo 式的 32.8% 和 AgentVigil 的 30.0%。

  10. arXiv:cs.AI(全量分类)39

    视觉敏感不等于主张可撤回:多模态强化学习中的持久性感知信用分配

    针对多模态强化学习中视觉敏感度与主张可撤回性的脱节问题,研究者提出持久性感知信用门控(PACG),通过衰减异常持久视觉主张的正向信用来修正信用分配。在 Qwen2.5-VL-7B 上,PACG 将 DAPO 的九基准三种子平均分从 58.1% 提升至 59.9%,VPPO 从 59.8% 提升至 60.9%,同时使无图像支持的主张更易撤回,且无需标注、不增加推理成本。

  11. arXiv:cs.AI(全量分类)33

    BRIDGE:面向检索信用感知的双层智能体强化学习

    BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。

  12. arXiv:cs.AI(全量分类)29

    AVIO:在音视频场景中学习添加与移除发声物体

    研究团队提出 AVIO,通过源条件特征调制改造预训练文本到音视频生成模型,让单一模型同时学会添加和移除发声物体,并支持仅凭指令编辑或可选视觉引导。配套数据集 AVIOBench 包含 37.9 小时配对音视频样本、覆盖 1,878 个目标物体名称,用共享身份与视觉掩码关联物体的视觉存在与声音贡献。参考帧课程训练逐步减少参考条件,使模型在添加物体时可通过可选参考控制外观与位置。

  13. arXiv:cs.AI(全量分类)24

    人机协作:从悖论到模式

    一篇论文从自主性与主动性两个设计维度考察人机协作,用悖论视角分析其中的内在张力,并据此映射出四种协作模式:指令、委派、辅助与共创。该工作将发表于第33届模式语言编程会议(PLoP 2026)。

  14. arXiv:cs.AI(全量分类)33

    再生公地中无崩溃的收获学习:一个拉格朗日框架

    研究者将再生公地建模为带设计者指定消耗预算的约束马尔可夫博弈或约束多智能体 MDP,提出非平稳拉格朗日框架,用无约束博弈或协作控制问题的解构造策略序列。该框架引入面向重置回合、带折扣奖励与终端成本的平均 epoch 解概念,并证明与奖励无关的可行性证书、协作可行性与近似最优性。

  15. arXiv:cs.AI(全量分类)38

    安全算子:通过谱优化调控安全指令的表达

    研究者提出"安全算子"概念,指出基于 Transformer 的语言模型中上下文 token 可被吸收为模型权重的乘法算子,其主特征值可连续调节安全指令对生成的影响强度。他们据此推导出带抑制权重的对比安全损失,通过调节该权重在有害与无害查询间权衡,映射出攻击成功率与过度拒答率之间的关系,并在不同参数化下获得 Pareto 改进的安全指令。

  16. arXiv:cs.AI(全量分类)36

    关系基础模型在上下文学习中的支持集目标泄漏:模型依赖性与评估可靠性

    研究揭示关系型上下文学习(ICL)中的支持集目标泄漏问题:当支持上下文包含目标衍生特征而查询端不可用时,评估结果会失真。作者构造 20 个目标衍生特征,在 13 个 RelBench 任务和 5 种关系 ICL 配置上测试,发现 0-hop 与 Full 泄漏造成最大偏差,且泄漏效应高度依赖任务与模型,甚至可逆转模型变体间的相对结论。

  17. arXiv:cs.AI(全量分类)32

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,在 LLM-as-Judge 评测中达到 95.3%,超过所有基线 LLM。它构建了 1,706 个文本块、10 个来源的知识库,并配有覆盖现有 ME/CFS 诊断框架的指南间冲突登记表,以及按查询焦点与冲突信号重排证据的校准流程。该评测避免了关键词匹配平均 10.1 个百分点的系统性低估,代码已开源。

  18. arXiv:cs.AI(全量分类)38

    简单机制接口如何引导 LLM 智能体决策:arXiv 研究

    一项 arXiv 研究在拍卖与匹配等多智能体环境中比较不同交互格式对 LLM 智能体决策的影响,发现英式拍卖接口能显著降低出价偏差。研究还显示,列出收益情形并解释真实出价为何安全可改善选择,而要求智能体规划匹配轮次或推测对手信念反而整体变差。在拍卖中,这些行为改善并未伴随智能体简短计划中策略理解语言指标的相应提升。

  19. arXiv:cs.AI(全量分类)39

    用 LLM 引导剪枝改进最近邻图索引

    研究者提出 LLM-Guided Graph Pruning(LGP)框架,用 LLM 推理直接优化已有 ANN 图索引,把结构上"低价值"的邻居替换为 LLM 选出的语义替代项,同时保留原图的稀疏性与可导航性。在 DiskANN 和 HNSW 等图索引上,LGP 在语义检索基准中端到端表现稳定优于贪心图搜索和 LLM 重排序。

  20. arXiv:cs.AI(全量分类)33

    HyperZip:用超网络与个性化扩散 LLM 实现高效数据压缩

    HyperZip 是一个基于扩散 LLM(dLLM)与 Multi-Token Prediction 的 LLM 数据压缩框架,通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据。它针对扩散压缩中解码吞吐量提升会降低压缩率的权衡,实现了低压缩率与高吞吐的兼顾,在压缩率与速度的权衡上优于现有 SOTA 基线。

  21. arXiv:cs.AI(全量分类)35

    ThuRunel:面向结构化咨询对话的动态解耦

    ThuRunel 是一个面向医疗美容、法律咨询、教育规划等高风险咨询场景的 AI 咨询智能体,通过有限状态信念管理框架、思维链教师合成协议与学习式生成适配器实现动态解耦。在 11 个基线对比中,ThuRunel 在信息采集完整度与专家简报质量上均取得一致提升。该智能体已以双语 Web 应用形式公开部署,基于精选知识库在每次回答中标注引用来源。

  22. arXiv:cs.AI(全量分类)40

    StateTape:面向长程编程智能体的动作条件证据生命周期建模

    针对长程编程智能体上下文随观察不断增长的问题,论文提出 StateTape 框架,将仓库建模为符号级代码图,用 tape 标记每次写入改动的符号,把过时判断从文本推断变为对写入的观察。该方法配合小型 manager 模型处理写入日志无法确定的部分,并给出理论分析与 TraceBench 基准。在六个编程智能体和三个编辑密集型基准上,StateTape 均取得更高解决率且计算开销很小。

  23. arXiv:cs.AI(全量分类)39

    OTROPE:基于最优传输的大语言模型鲁棒离线策略评估

    研究者提出 OTROPE,一种无需似然函数的 LLM 离线策略评估方法,通过最优传输在语义空间做分布校正,将行为策略的标注样本与目标策略的无标注样本对齐。它结合校正后的人类标注残差与代理预测器,无需行为策略建模或密度比估计,即可实现双重鲁棒式评估。实验显示 OTROPE 持续优于基线,并能让较弱 LLM 评估器集成逼近甚至超越更强评估器,代码已开源。

  24. arXiv:cs.AI(全量分类)41

    如何缓解大型推理模型中的欺骗性安全对齐

    针对大型推理模型(LRM)中推理链与最终答案安全信号不一致的"欺骗性安全对齐"现象,研究者提出 DSAR 指标进行量化,发现该现象在标准提示下普遍存在,并在 prefilling 攻击下显著放大。为此提出基于 RL 的 SARA 方法,同时奖励安全感知推理与安全最终答案,在标准与对抗设置下均显著缓解该问题,并保持有用性与效用。

  25. arXiv:cs.AI(全量分类)35

    CoRe:协同演化奖励模型,缓解视频扩散模型中的潜在奖励攻击

    针对固定潜在奖励模型优化会导致"潜在奖励攻击"、生成视频感知与运动质量下降的问题,研究者提出协同演化奖励框架 CoRe,持续用生成器当前样本重训奖励模型并锚定真实视频偏好,防止生成器通过偏离数据分布刷高奖励。在 Wan2.1-T2V-1.3B 上,CoRe 的生成质量优于预训练模型和既有对齐方法,且避免了固定奖励优化的质量崩溃。