SGLang 在 NVIDIA GB300 NVL72 上实现最高 25 倍推理性能提升
SGLang 与 NVIDIA 合作在 GB300 NVL72 上实现最高 25 倍推理性能提升,基于 SemiAnalysis InferenceXv2 运行 DeepSeek R1 对比 H200(50 TPS/user 延迟约束)。
SGLang 与 NVIDIA 合作在 GB300 NVL72 上实现最高 25 倍推理性能提升,基于 SemiAnalysis InferenceXv2 运行 DeepSeek R1 对比 H200(50 TPS/user 延迟约束)。
SGLang 团队回顾了在 NVIDIA GTC 2026 的三天五场活动,包括黄仁勋 GTC 主题演讲中 SGLang 出现在 NVIDIA AI 生态幻灯片上,以及 Ying Sheng 参与的"开源 AI 现状"圆桌。
LMSYS 宣布 2026 博士奖学金首位获得者为 Will Lin,表彰其对开源 AI 基础设施的持续贡献,奖学金最高 5 万美元用于学费。Will Lin 是 UC San Diego 六年级博士生,主导开源扩散生成框架 FastVideo,该项目已获 3.7k+ GitHub stars,并被 NVIDIA Dynamo 集成为后端。
Netpreme X-Mem™ MPU 作为专用 KV 内存层接入 SGLang HiCache,在前缀密集型负载下将首 token 延迟(TTFT)较 Host DRAM 方案降低 6.7 倍。
METR 是一家研究非营利机构,致力于评估前沿 AI 系统是否可能对社会构成灾难性风险,并构建准确评估风险的科学方法。其部分开源智能体可在 github.com/poking-agents 找到,Vivaria 项目已弃用。
METR 研究员为提升 AI 智能体评测安全性,构建了一个逐操作监控器,可在人工审核前拦截可疑的工具调用。团队在论证监控有效性时发现,仅拦截工具调用并不总能阻止其执行,例如编码智能体可能未经请求就"批准"被拦截的操作。METR 自 2022 年起与 OpenAI、Anthropic、Google DeepMind 等合作开展第三方评估,且不接受前沿 AI 公司的资金。
ARC Evals 计划在未来几个月内从 Alignment Research Center(ARC)分拆,成为独立组织。ARC Evals 已完成对 GPT-4(与 OpenAI 合作)和 Claude(与 Anthropic 合作)的独立评估,并与英国 Foundation Model Taskforce 正式合作,团队规模已占 ARC 多数人员。
ARC Evals 结束在 Alignment Research Center 的孵化期,分拆为独立非营利组织 501(c)(3),并更名为 METR(Model Evaluation & Threat Research)。
METR(原 ARC Evals)公开悬赏征集用于衡量自主 LLM 智能体能力的任务,包括任务创意、详细规格和经过测试的实现。任务需足够难,人类专业人士完成需超过 2 小时、理想情况超过 20 小时,且最好能通过写代码、命令行等文本交互完成。创意奖励 $20,规格 $200,实现按人工完成成本 3 倍起付并叠加最高 50% 的加分。
METR 总结其首个完整运营年度(2023年)的成果:开发了在真实自主任务上评估 LM 智能体的初始方法论,该测试被纳入 OpenAI 发布 GPT-4 的系统卡。
METR 正式确立新领导架构:Emma Abele 出任执行董事,Beth Barnes 转任研究负责人。Emma 于 2023 年 3 月以幕僚长身份加入 METR,此前数月已以执行董事身份试运行,Beth 同期试任研究负责人,该安排经试验后正式落地。
METR 正在招募 ML 研究工程师和科学家,推进针对 AI R&D 能力的评估开发,目标是在 AI 智能体可能大幅自我提升、引发危险能力"爆炸"之前提供早期预警。METR 已开始开发阈值评估,用于判断 AI R&D 能力是否达到需要信息安保等防护措施的程度,并计划逐步建立能平滑追踪进展的评估体系。该机构称,具备丰富 ML 研发经验的研究者和工程师是当前评估进展的主要瓶颈。
The Audacious Project 为 METR 与 RAND 合作的 Canary 项目促成约 3800 万美元资助,其中约 1700 万美元将支持 METR 的工作。Canary 专注于开发和部署评估方法,以监测 AI 系统的危险能力。METR 将用这笔资源评估前沿 AI 系统作为自主智能体的能力,并支持企业、政府及研究伙伴运行这些测试。
METR 发布博文,介绍其保护非公开模型访问和专有信息的保密与安全措施,包括六级保密分级、动物代号(如 playful-panda)指代非公开模型、Slack 与文档前缀标注,以及 FIDO2 认证、VPN 加 SSO、私有 VPC 和 SIEM 监控等控制。这些措施帮助 METR 获得 SOC 2 Type I 认证,相关做法截至 2026 年 2 月 17 日有效。
METR 在近 6 个月获得约 7100 万美元资助承诺,用于研究自主能力、追踪递归自我改进、评估监控系统、开展风险评估和调查 AI 事件等项目。METR 表示未接受前沿 AI 公司资助,也不接受其员工捐赠,但这些公司为其评测、研究和工程提供大量免费 token。
MIT Transit Lab 获 Google.org 210 万美元资助,将开发公共交通智能中枢 PTIQ,把公交机构的实时监控、运营控制与乘客沟通系统整合为单一 AI 编排平台。
Liquid AI 公布 upcoming events 日程,将在全球科技行业活动上亮相,时间覆盖 2026 年 10 月 6 日、10 月 14 日、10 月 23–24 日、10 月 23–25 日以及 2027 年 3 月 7–10 日。官方表示,若你也会到场,可与其取得联系。
Liquid AI 发布 LFM2.5-VL-DSpark,用于在边缘设备及更广场景加速视觉语言模型。该模型属于 LFM2.5 系列,此前同系列已推出 LFM2.5-DSpark,实现从 H100 到 MacBook 最高 3.2 倍推理加速。
Liquid AI 开放 18 个研究与工程岗位,包括 ML 研究工程师、GPU 性能工程师、分布式训练工程师、多模态音频、推理系统与 GPU 基础设施等方向,工作地点为旧金山、波士顿、远程或混合办公。另有 4 个应用岗(后训练、音频、视觉、RecSys)和 1 个产品与监管副总法律顾问岗。所有 LFM 模型均可免费下载、运行和微调。
Liquid AI 是一家效率优先的基础模型公司,由 MIT CSAIL 分拆出的四位创始人 Ramin Hasani(CEO)、Mathias Lechner(CTO)、Alexander Amini(CSO)和 Daniela Rus 创立,目标是构建在各规模上都高效、通用、对齐且可信的 AI 系统。其产品强调算力与成本优化,可在任意设备和媒介上部署智能。
Liquid AI 上线 Discord 社区服务器,目前显示 507 人在线、4,879 名成员。该服务器提供文字与语音频道,支持自定义反应、嵌入内容和机器人,用户可随时进出频道而无需通话或邀请。
Liquid AI 公布其黑客松系列活动回顾与日程,开发者围绕 Liquid Foundation Models 构建端侧应用。已举办的 6 场活动覆盖东京、旧金山及线上,涉及 LFM2.5、LFM2.5-VL、LFM2-VL 与 LEAP,可在 AMD Ryzen AI PC、AMD NUC 及 iOS、Android 应用上部署。目前日历上暂无新黑客松,可留邮箱等待通知。
Goodfire AI 发布 Silico 平台使用条款,界定客户访问和使用其 AI/ML 模型理解、测试、评估、改进、引导、监控与对齐平台的权利义务。条款明确 Customer Materials、Goodfire IP、Usage Data、Workflow Data 等定义,并授予客户非独占、不可转让的内部业务使用权。
斯坦福 Marlowe 超算配备 248 块 NVIDIA H100 GPU、31 个计算节点,横跨全部七所学院服务 190 多个研究组,30 天平均分配率 95%,累计交付 315 万 GPU-hours。
Phylo 在 Fireworks 上部署开源权重模型,实现月环比用户增长 2 倍、成本降低 60%,大部分流量已转向开源模型,首 token 时间约减半。其 Biomni Lab 是首个集成生物学环境,智能体单次任务可运行数小时至数天、调用数百次工具,新开源模型可在 24 小时内上线生产。
Cursor 宣布通过 AIUC-1 智能体安全、安全性和可靠性认证,认证由 Schellman 开展独立审计,并在数千个场景中对智能体进行对抗性测试,覆盖 IDE 和云端智能体的规则、钩子和 Auto-review 等防护措施。
Anthropic 是一家公益公司,致力于构建以安全为前沿的 AI 研究与产品,确保 AI 的收益并降低其风险。其官方博客汇集了 Claude、Science、AI 安全核心观点、负责任扩展政策、对齐科学、Anthropic Academy、经济指数以及 Claude 宪法等发布与公告内容。
Balyasny Asset Management 在数千个真实金融任务上评测 Claude Fable 5,Fable 取得 89.4% 对前代生产模型 86.1% 的成绩,并在复杂规划、分析与智能体执行上表现突出。该机构自建执行框架与 BAMAgent 平台,支持数千个自主智能体 7×24 小时运行,Fable 成为其投资团队系统化与编码工作的首选前沿模型。
Asana 让 AI 智能体直接运行在其 Work Graph 模型内,与人类同事一样拥有角色、任务、消息读写和活动流记录,并由 Claude 驱动复杂任务。每个智能体按内容撰写、洞察分析、项目管理等角色预置技能与集成,其有效访问权限受触发者权限约束。智能体的共享记忆仅允许管理员和编辑者写入永久记忆,普通成员反馈只作用于当前任务。
Anthropic CEO Dario Amodei 在 Stripe 的 "A Cheeky Pint" 播客中与 John Collison 对话,谈及 Anthropic 年化收入(ARR)增长至约 50 亿美元。他讨论了 AI 模型表现出的"资本逐利冲动"、对智能体未来的预测、模型生意的经济学,以及 19 世纪活力论(vitalism)概念。
Infosys 与 Cognition 达成合作,将在其组织内部及全球客户群中部署 AI 软件工程师 Devin,先在金融服务业务落地,覆盖银行、支付、资本市场、保险和财富管理场景,再扩展至零售、能源、医疗等行业。
Cognition 在伦敦开设办公室,将自主软件工程推向欧洲领先企业。过去一年,全球多家大型金融机构已采用 Devin 覆盖 SDLC 工作,包括大规模现代化与迁移、安全漏洞修复以及复杂代码库文档化,Cognition 的合作伙伴包括 Goldman Sachs、Santander、Citi、BNY、HG Capital 和 The Access Group 等。
Cognizant 与 Cognition 达成合作,将在其工程组织和全球客户中部署 Devin 与 Windsurf。Cognizant 工程师已使用 Windsurf IDE 进行智能体辅助的流式编码,并正在探索 Devin 在代码迁移、重构、测试和维护等工程工作流中的自主端到端执行能力。
Cognition 宣布成立 Cognition Japan,这是其首次进入亚洲市场,并任命在 IBM、Microsoft、Workday、Datadog Japan 任职过的 Takumi Masai 为日本总裁兼总经理。
Mercedes-Benz 与 Cognition 达成合作,在全球工程团队部署 Devin 和 Windsurf,覆盖美国、欧洲和亚洲,是汽车行业规模最大的 AI 软件工程部署之一。
Cognition 在新加坡开设亚太总部,由副总裁兼亚太区总经理 Richard Spence 领导,覆盖东南亚、澳大利亚、印度和韩国市场。新加坡企业 OCBC 使用其平台后,代码与测试用例生成效率提升最高 30%,系统集成测试首次通过率从不足 50% 升至 80% 以上。Cognition 已在东京和新加坡部署团队,并正招聘工程、市场与合作伙伴岗位。
Cognition 宣布融资超 10 亿美元,估值 260 亿美元,由 Lux Capital、General Catalyst 和 8VC 领投。企业用量今年初以来增长超 10 倍,run-rate 收入达 4.92 亿美元;Mercedes-Benz 将八个月的遗留系统改造项目缩短到八天,Itaú 用 Devin 自动修复 70% 的安全漏洞。
推荐理由:原文由当事公司自述融资规模与业务数据,读者可以据此了解 Devin 的企业采用情况和自研模型进展。
Baseten 公布适用于 Dedicated Inference 和 Model APIs 的服务等级协议,承诺每月 System Availability 不低于 99.9%,按月度监控记录计算。未达标时客户可申请服务补偿,单月补偿上限为当月应付费用的 40%,且需自行发邮件申请。该 SLA 不适用于客户自托管部署的服务。
Baseten 提供 Baseten Inference Stack,用于构建产品级或内部编码智能体,并支持高性能、可扩展、低成本地部署和推理 AI 模型,可运行在 Baseten 云端或用户自有环境。页面引导用户联系其产品专家了解具体方案。
Baseten 正在招聘跨学科团队,构建其所谓的“推理云”(Inference Cloud),认为 AI 的未来是数百万个专用模型嵌入各类产品,而推理决定性能、可靠性、延迟与经济性。Abridge、Cursor、Lovable、Notion、OpenEvidence 等公司已依赖 Baseten 支撑生产环境的 AI 工作负载。