Microsoft Copilot 推出 Home、Code 和 Autopilot 新功能
Microsoft 发布新版 Copilot,新增 Home、Code 和 Autopilot 三项功能。该消息由 Microsoft AI 官方博客在拉丁美洲频道公布,页面同时列出 Quine 生物研究 AI 系统、Microsoft Agent 365 及 Codelco 采用 Microsoft 365 Copilot 等相关内容。
Microsoft 发布新版 Copilot,新增 Home、Code 和 Autopilot 三项功能。该消息由 Microsoft AI 官方博客在拉丁美洲频道公布,页面同时列出 Quine 生物研究 AI 系统、Microsoft Agent 365 及 Codelco 采用 Microsoft 365 Copilot 等相关内容。
MiniMax 在 NVIDIA GTC 期间举办 AI Founder Day,并推出首个自进化模型 M2.7。现场演示显示 M2.7 可处理复杂任务、迭代编辑与工具调用,接近“精英级工程师”表现。联合创始人云叶一在主题演讲中提出智能体时代,强调模型正成为可规划、执行与迭代的系统核心组件。
METR 发布参考文件,汇总加州 SB 53、欧盟 Code of Practice、纽约 RAISE Act 和伊利诺伊 SB 315 对前沿 AI 开发者的安全与安保义务,涵盖事件报告、模型评估、安全缓解、内部治理与举报人保护。
SGLang 与 NVIDIA 合作在 GB300 NVL72 上实现最高 25 倍推理性能提升,基于 SemiAnalysis InferenceXv2 运行 DeepSeek R1 对比 H200(50 TPS/user 延迟约束)。
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
LMSYS 宣布 2026 博士奖学金首位获得者为 Will Lin,表彰其对开源 AI 基础设施的持续贡献,奖学金最高 5 万美元用于学费。Will Lin 是 UC San Diego 六年级博士生,主导开源扩散生成框架 FastVideo,该项目已获 3.7k+ GitHub stars,并被 NVIDIA Dynamo 集成为后端。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较 Host DRAM 方案降低 6.7 倍。
RadixArk 与 Google Cloud 宣布合作,把开源推理框架 SGLang 带到 Google TPU 上。
METR 汇总了多家 AI 公司发布的前沿 AI 安全政策清单,涵盖 Amazon、Anthropic、Google DeepMind、G42、Meta、Microsoft、OpenAI 和 xAI。该清单发布于 2025 年 2 月 8 日,原文为西班牙语,可阅读英文版本。
METR 发布隐私政策,说明其网站对未受全面数据保护地区(如美国)的访客加载 Google Analytics,对 145 个司法管辖区及发送 DNT/GPC 信号的访客不加载任何追踪。招聘流程通过 Lever 进行,并使用 AI 检测服务 Pangram 筛查申请材料,被判定为几乎完全由 AI 生成的申请会被转入降级处理阶段。
METR 是一家研究非营利机构,致力于评估前沿 AI 系统是否可能对社会构成灾难性风险,并构建准确评估风险的科学方法。其部分开源智能体可在 github.com/poking-agents 找到,Vivaria 项目已弃用。
METR 研究员为提升 AI 智能体评测安全性,构建了一个逐操作监控器,可在人工审核前拦截可疑的工具调用。团队在论证监控有效性时发现,仅拦截工具调用并不总能阻止其执行,例如编码智能体可能未经请求就"批准"被拦截的操作。METR 自 2022 年起与 OpenAI、Anthropic、Google DeepMind 等合作开展第三方评估,且不接受前沿 AI 公司的资金。
ARC Evals 计划在未来几个月内从 Alignment Research Center(ARC)分拆,成为独立组织。ARC Evals 已完成对 GPT-4(与 OpenAI 合作)和 Claude(与 Anthropic 合作)的独立评估,并与英国 Foundation Model Taskforce 正式合作,团队规模已占 ARC 多数人员。
ARC Evals 结束在 Alignment Research Center 的孵化期,分拆为独立非营利组织 501(c)(3),并更名为 METR(Model Evaluation & Threat Research)。
METR(原 ARC Evals)公开悬赏征集用于衡量自主 LLM 智能体能力的任务,包括任务创意、详细规格和经过测试的实现。任务需足够难,人类专业人士完成需超过 2 小时、理想情况超过 20 小时,且最好能通过写代码、命令行等文本交互完成。创意奖励 $20,规格 $200,实现按人工完成成本 3 倍起付并叠加最高 50% 的加分。
METR 总结其首个完整运营年度(2023年)的成果:开发了在真实自主任务上评估 LM 智能体的初始方法论,该测试被纳入 OpenAI 发布 GPT-4 的系统卡。
METR 正式确立新领导架构:Emma Abele 出任执行董事,Beth Barnes 转任研究负责人。Emma 于 2023 年 3 月以幕僚长身份加入 METR,此前数月已以执行董事身份试运行,Beth 同期试任研究负责人,该安排经试验后正式落地。
METR 正在招募 ML 研究工程师和科学家,推进针对 AI R&D 能力的评估开发,目标是在 AI 智能体可能大幅自我提升、引发危险能力"爆炸"之前提供早期预警。METR 已开始开发阈值评估,用于判断 AI R&D 能力是否达到需要信息安保等防护措施的程度,并计划逐步建立能平滑追踪进展的评估体系。该机构称,具备丰富 ML 研发经验的研究者和工程师是当前评估进展的主要瓶颈。
The Audacious Project 为 METR 与 RAND 合作的 Canary 项目促成约 3800 万美元资助,其中约 1700 万美元将支持 METR 的工作。Canary 专注于开发和部署评估方法,以监测 AI 系统的危险能力。METR 将用这笔资源评估前沿 AI 系统作为自主智能体的能力,并支持企业、政府及研究伙伴运行这些测试。
METR 就美国商务部工业与安全局(BIS)关于先进 AI 模型与计算集群报告要求的提案提交意见,建议加强报告信息的收集与存储安全,并修订 AI 红队测试条款。
METR 发布了一份由 AI 公司发布的前沿安全政策清单,涵盖 Amazon、Anthropic、Google DeepMind、G42、Meta、Microsoft、OpenAI 和 xAI。
METR 向美国 OSTP 提交 AI 行动计划建议,提出四项优先行动:与私营部门合作提升头部 AI 开发者的信息安全与内部控制;牵头制定衡量 CBRN 武器开发、网络攻击、长时程自主性、自动化 AI 研发与控制颠覆等能力的正式标准;按规模阈值要求训练与部署报告及外部监督;测量头部开发者与关键行业的研发自动化程度。
METR 审阅了 OpenAI 在发布 gpt-oss-120b 前开展的对抗性恶意微调(MFT)实验方法,共提出 17 条建议,其中 6 条为高紧急度,覆盖 Preparedness Framework (v2) 中生物化学与网络安全两个追踪类别。
METR 发布博文,介绍其保护非公开模型访问和专有信息的保密与安全措施,包括六级保密分级、动物代号(如 playful-panda)指代非公开模型、Slack 与文档前缀标注,以及 FIDO2 认证、VPN 加 SSO、私有 VPC 和 SIEM 监控等控制。这些措施帮助 METR 获得 SOC 2 Type I 认证,相关做法截至 2026 年 2 月 17 日有效。
METR 员工 David Rein 用三周时间对 Anthropic 内部智能体监控与安全系统进行红队测试,发现多个具体的新型漏洞,其中部分已被修复,且均未严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。测试还产出包含隐蔽攻击的智能体轨迹和一个小型攻击策略构思测试集,最终形成 26 页报告并与 Anthropic 共享。
METR 在近 6 个月获得约 7100 万美元资助承诺,用于研究自主能力、追踪递归自我改进、评估监控系统、开展风险评估和调查 AI 事件等项目。METR 表示未接受前沿 AI 公司资助,也不接受其员工捐赠,但这些公司为其评测、研究和工程提供大量免费 token。
METR 公布今年两起安全事件,称无敏感信息被访问。2026 年 3 月,攻击者通过一个存在 fail-open 漏洞的公开 EC2 实例窃取了公共模型 API key。
推荐理由:METR 作为当事方复盘两起真实攻击的细节与响应措施,读者可从中了解 AI 实验室安全事件的实际形态和可借鉴的防护做法。
Stainless 团队于 2026 年 5 月 18 日宣布加入 Anthropic 并关停包括 SDK 生成器在内的托管产品,LlamaIndex 撰文复盘为何当初选择 Stainless 以及迁移中的经验。
MIT Transit Lab 获 Google.org 210 万美元资助,将开发公共交通智能中枢 PTIQ,把公交机构的实时监控、运营控制与乘客沟通系统整合为单一 AI 编排平台。
LlamaIndex 正在招聘,邀请人才加入其不断壮大的团队。文中列出公司文化原则:目标导向、信息透明、快速辩论与行动、以钢人化思维假设他人善意,以及主动优于被动。文中还强调做正确的事比做安全的事更重要,并对 AI 保持热情。
LlamaIndex 的使命是自动化知识工作,从最难的前沿——文档入手,打造全球最强的智能体文档 OCR,把杂乱的多模态文档转化为结构化、可靠的数据。通过 LlamaAgents,开发者与企业可围绕文档构建从摄取、抽取到推理与自动化的可靠工作流。团队规模虽小,但强调交付经过深思、可靠且可扩展的生产级产品。
Liquid AI 公布 upcoming events 日程,将在全球科技行业活动上亮相,时间覆盖 2026 年 10 月 6 日、10 月 14 日、10 月 23–24 日、10 月 23–25 日以及 2027 年 3 月 7–10 日。官方表示,若你也会到场,可与其取得联系。
Liquid AI 发布 LFM2.5-VL-DSpark,用于在边缘设备及更广场景加速视觉语言模型。该模型属于 LFM2.5 系列,此前同系列已推出 LFM2.5-DSpark,实现从 H100 到 MacBook 最高 3.2 倍推理加速。
Liquid AI 开放 18 个研究与工程岗位,包括 ML 研究工程师、GPU 性能工程师、分布式训练工程师、多模态音频、推理系统与 GPU 基础设施等方向,工作地点为旧金山、波士顿、远程或混合办公。另有 4 个应用岗(后训练、音频、视觉、RecSys)和 1 个产品与监管副总法律顾问岗。所有 LFM 模型均可免费下载、运行和微调。
Liquid AI 是一家效率优先的基础模型公司,由 MIT CSAIL 分拆出的四位创始人 Ramin Hasani(CEO)、Mathias Lechner(CTO)、Alexander Amini(CSO)和 Daniela Rus 创立,目标是构建在各规模上都高效、通用、对齐且可信的 AI 系统。其产品强调算力与成本优化,可在任意设备和媒介上部署智能。
Liquid AI 上线 Discord 社区服务器,目前显示 507 人在线、4,879 名成员。该服务器提供文字与语音频道,支持自定义反应、嵌入内容和机器人,用户可随时进出频道而无需通话或邀请。
Liquid AI 公布其黑客松系列活动回顾与日程,开发者围绕 Liquid Foundation Models 构建端侧应用。已举办的 6 场活动覆盖东京、旧金山及线上,涉及 LFM2.5、LFM2.5-VL、LFM2-VL 与 LEAP,可在 AMD Ryzen AI PC、AMD NUC 及 iOS、Android 应用上部署。目前日历上暂无新黑客松,可留邮箱等待通知。
据 The Information 报道,Google 启动试点计划,按内容对 AI Overviews、AI Mode 和 Gemini 的贡献程度向出版商付费,约 100 家出版商参与。一位早期加入的出版商一年获得超过 100 万美元,另一位加入数月的获得约 5 万至 6 万美元。该计划推出之际,Google 正面临出版商诉讼及英国和欧盟监管机构对其 AI 搜索影响流量的审查。
Meta 发布 Muse AI 智能体,宣称可帮用户处理邮件、在线购物等任务,用户需交出数据甚至信用卡才能使用。此后 Meta 宣布了类似电子宠物的 Muse Charm 配件、面向企业的 Muse Enterprise Platform、Mac 应用和智能眼镜支持,并修补了一个可让攻击者控制该智能体的漏洞;Amazon 屏蔽了 Muse 智能体。
Goodfire AI 发布 Silico 平台使用条款,界定客户访问和使用其 AI/ML 模型理解、测试、评估、改进、引导、监控与对齐平台的权利义务。条款明确 Customer Materials、Goodfire IP、Usage Data、Workflow Data 等定义,并授予客户非独占、不可转让的内部业务使用权。