跳到正文

全部动态

今日 44 条
9月30日周三
  1. Microsoft AI:官方博客(网页)15

    Windows 365 入选 Gartner 桌面即服务魔力象限

    微软 Windows 365 被列入 Gartner 2026 年 8 月 5 日发布的桌面即服务(DaaS)魔力象限报告,报告作者为 Stuart Downes、Todd Larivee 与 Sunil Kumar。Gartner 同时声明不背书报告中出现的任何厂商、产品或服务,也不建议用户只选择评分最高的厂商。

  2. Microsoft AI:官方博客(网页)19

    Microsoft Edge 集成 Copilot:用 Copilot Vision 扫描屏幕并个性化辅助浏览

    Microsoft Edge 将 Copilot 集成进各标签页,可协助比较选项、解释重点,并结合浏览历史提供更个性化的帮助。新增的 Copilot Vision 能查看用户屏幕,即时扫描、分析并给出建议。Edge 还提供节能模式,平均延长 25 分钟电池续航,并内置面向 PC 游戏的 Edge for Game Bar。

  3. METR:Research(网页)65

    METR 研究列表:模型自主能力评测与开发者生产力研究汇总

    METR 的研究页面汇总了其评测与研究项目,包括对 GPT-5、Claude 3.7、DeepSeek 和 Qwen 等模型的危险自主能力评测,以及 time horizon 估计、RE-Bench、HCAST 基准和开发者生产力随机对照试验等研究。其中一项试验发现,经验丰富的开源开发者使用 AI 工具后耗时反而增加 19%。

    推荐理由:这是 METR 的研究索引页,汇总了其在模型自主能力评测、time horizon 与开发者生产力等方向的代表性论文。

  4. Microsoft AI:官方博客(网页)25

    Microsoft Surface 新品发布:Surface Laptop Ultra 与 Copilot+ PC 功能

    Microsoft 发布 Surface 系列新品,包括面向创作者的性能笔记本 Surface Laptop Ultra,该产品目前为预发布状态,功能可能变动。Surface Laptop 13 英寸本地视频播放续航最高 22.5 小时,Surface Pro 12/13 英寸均为 15.5 小时。Copilot+ PC 功能仅在 16GB 及以上内存的部分配置上提供。

  5. Microsoft AI:官方博客(网页)13

    Windows:Windows Hello 免密登录与本地 AI 功能对比其他操作系统

    微软在 Windows 宣传页中主推 Windows Hello,用户可用人脸、指纹或 PIN 免密登录,无需记忆或输入密码。页面以灵活性、兼容性、本地 AI、游戏生态和内置 Microsoft 安全防护五个维度对比 Windows 与其他主流操作系统,并称 Windows 拥有最大的 PC 游戏生态。本地 AI 功能依赖硬件,且随设备而异。

  6. METR:Research(网页)68

    ARC 发布 GPT-4 与 Claude 危险能力评估更新

    ARC(现 METR)作为第三方评估方,与 Anthropic 和 OpenAI 合作,在受控环境中测试 GPT-4 和 Claude 是否具备自主获取资源、躲避人类监督的危险能力。

    推荐理由:ARC 以第一方视角给出红队评估的方法与任务实例,读者可了解自主复制能力测试如何设计与执行。

  7. Microsoft AI:官方博客(网页)34

    Azure Container Apps Sandboxes 正式可用,为 AI 智能体提供快速隔离沙箱基础设施

    Azure Container Apps Sandboxes 已正式可用,为 AI 智能体提供快速、隔离的沙箱基础设施。Azure 同时提供 Microsoft Foundry、Microsoft Fabric、Microsoft IQ 等产品,用于构建、评估和部署生成式 AI 方案与自定义智能体。Azure HorizonDB 处于预览阶段,是基于 PostgreSQL 的云数据库服务。

  8. METR:Research(网页)42

    METR 首份公开报告:评估 LLM 智能体在真实自主任务中的表现

    ARC Evals(现 METR)发布首份公开报告,提出"自主复制与适应"(ARA)评估方法,用 12 项难度递增的真实任务测试基于 Claude 和 GPT-4 的 4 个 LLM 智能体。结果显示这些智能体只能完成最简单的 ARA 任务,在较难任务上仅有部分进展,表明普通用户难以借此造出危险的自主智能体。

  9. METR:Research(网页)43

    METR 发布 AI 智能体评估任务标准 METR Task Standard

    METR 发布了一套定义 AI 智能体能力评估任务的标准 METR Task Standard,目前已有超过 1,000 个任务采用该标准,覆盖 AI 研发、网络安全和通用自主能力等领域。英国 AI Safety Institute 等机构也在使用该标准,以便与 METR 交换任务。该标准通过 2–6 个函数和一个常量完整定义任务族,支持任务可移植性与代码复用,未来计划成为公共资源。

  10. Microsoft AI:官方博客(网页)11

    微软 Diversity & Inclusion:用 AI 技能与无障碍创新推动多元共融

    微软 Diversity & Inclusion 栏目汇集多篇文章,讲述新一代墨西哥创业者用 AI 技能解决本地挑战,以及 AI 如何服务常被忽视的人群、帮助神经多样性专业人士展现优势。栏目还涵盖 Xbox 支持原住民声音的游戏合集、LGBTQIA+ 故事,以及 AI 在无障碍与神经多样性中的包容性创新。

  11. METR:Research(网页)54

    METR 发布 AI 自主能力评估示例协议

    METR 发布一份评估 AI 模型自主风险能力的示例协议,覆盖任务套件、引导流程和评分方法。协议按任务所需人力时间分 0-6 级(1 分钟到 256 小时),将任务成功率聚合成连续的 "horizon" 分数,并给出从分数到缓解措施的阈值映射建议。

  12. METR:Research(网页)46

    METR 发布前沿模型自主能力评估资源集,含任务套件与评估协议

    METR 公开了一套用于评估前沿模型潜在危险自主能力的资源,包括任务套件、软件工具、能力激发指南和评估协议示例。任务覆盖软件工程、ML 工程、网络安全与研究领域,难度从人类几分钟到一周不等,仅开源约 20 个示例任务的源码。该协议被定位为“beta”,METR 计划持续迭代改进。

  13. Microsoft AI:官方博客(网页)10

    Microsoft 创新专题:AI 驱动的图书馆、量子计算与数据中心冷却等进展

    Microsoft 创新专题汇集多项进展:一个 AI 驱动的图书馆让人们以全新方式与 Theodore Roosevelt 互动,Microsoft Discovery 正加速 BHP 的铜创新。此外还介绍了 Majorana 2、用低成本 MicroLED 提升数据中心能效的网络创新,以及微流控技术让 AI 芯片冷却效果提升至多三倍。

  14. METR:Research(网页)47

    METR 更新通用能力评估:新增约 50 项任务与人类基线,公布 GPT-4o 和 Claude 初步结果

    METR 发布通用自主能力评估更新,新增约 50 项自动评分任务,覆盖网络安全、软件工程和机器学习等技能,并收集约 200 条人类基线。初步结果显示,基于 Claude 3.5 Sonnet 和 GPT-4o 的智能体完成任务的比例与人类基线者约 30 分钟的表现相当;GPT-4o 智能体可完成约 60% 人类 15 分钟内完成的任务,以及约 10% 人类耗时超 4 小时的任务。

  15. METR:Research(网页)46

    METR 解析 AI 智能体“失控复制”威胁模型

    METR 发布博文分析 AI 智能体的“失控复制”威胁模型,认为不存在阻止其大规模繁殖的决定性障碍。智能体只需占据当前 BEC 诈骗市场 5% 即可年入数亿美元,并可在无合法业务的情况下获取约 1% 的算力。METR 已降低该威胁模型的优先级,转而研究通用自主性能力。

  16. MiniMax:Blog(网页)75

    MiniMax 发布 M2.5 模型,SWE-Bench Verified 达 80.2%

    MiniMax 发布 MiniMax-M2.5,在 SWE-Bench Verified 得分 80.2%、Multi-SWE-Bench 51.3%、BrowseComp 76.3%,完成 SWE-Bench Verified 评测比 M2.1 快 37%,与 Claude Opus 4.6 的 22.9 分钟持平。

    推荐理由:官方公布了 M2.5 在编码、搜索和办公场景的成绩与价格细节,读者可以据此比较它与同类模型的性价比。

  17. MiniMax:Blog(网页)72

    MiniMax 发布 M2.7:SWE-Pro 得分 56.22%,展示模型自进化工作流

    MiniMax 发布 M2.7 模型,已在 MiniMax Agent 和 API 平台全面可用。该模型在 SWE-Pro 得分 56.22%(接近 Opus 4.6),VIBE-Pro 55.6%,Terminal Bench 2 57.0%,GDPval-AA ELO 1495 为开源模型最高,MM Claw 准确率 62.7%。

    推荐理由:官方给出了各基准的具体分数和自进化工作流细节,读者可以据此与同档模型做直接比较。