Anthropic 展示 Claude 编程能力:Opus 5.5 在 Terminal-Bench 4.0 得分 66.4%
Anthropic 公布 Claude 在编程场景的能力数据:Opus 5.5 在 Terminal-Bench 4.0 上得分 66.4%,为某 AI 平台客户带来 60 倍更快的代码审查反馈,为某企业软件客户将测试运行时间缩短 95%。
Anthropic 公布 Claude 在编程场景的能力数据:Opus 5.5 在 Terminal-Bench 4.0 上得分 66.4%,为某 AI 平台客户带来 60 倍更快的代码审查反馈,为某企业软件客户将测试运行时间缩短 95%。
Claude Code 面向企业遗留代码库的现代化改造,结合 AI 代码生成与深度代码库理解,在保持业务逻辑完整的前提下支持可扩展迁移。它能生成依赖图、识别死代码、按复杂度与业务影响排定重构优先级,并自动为重构代码创建单元测试、补充回归测试。该工具可接入现有 CI/CD 流水线与版本控制系统,满足企业级安全与合规要求。
Anthropic 发布工程长文,介绍用 Claude 构建能规划、行动与协作的 AI 智能体,并称 Claude 在客户支持到编程等智能体场景中表现优于其他模型。
Anthropic 公布 Claude 订阅方案:Free 档 $0,Pro 档年付 $17/月($200 一次性付清)、月付 $20,Max 档 $100/月起,可选 Pro 5 倍或 20 倍用量。
Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。
推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。
Anthropic 推出 Agent Skills,用带 SKILL.md 的文件夹把流程和最佳实践变成 Claude 可自动调用的能力。同一 Skill 可跨 Claude.ai、Claude Code 和 API 使用,支持多 Skill 组合,内置 Excel、PowerPoint、数据分析等常用技能,Box、Notion、Figma、Canva 等伙伴展示了各自的应用方式。
推荐理由:Anthropic 官方页面说明 Skills 的构建方式、跨平台复用和内置能力,读者可以据此判断是否将其纳入自己的工作流。
Anthropic 推出 Claude for Microsoft 365,Claude 可直接在 Excel、PowerPoint、Word 和 Outlook 中工作。
推荐理由:原文来自官方,给出了四大 Office 应用中的具体能力和可用性细节,读者可据此评估是否替换现有办公工作流。
Anthropic 推出 Claude in Chrome 扩展,面向所有付费计划开放,可读取当前登录页面并代替用户点击、输入和填写表单。
推荐理由:官方产品页说明了 Claude in Chrome 的能力边界、三种访问方式和安全机制,读者可据此判断是否将其纳入自己的浏览器工作流。
Anthropic 推出 Claude Security,面向 Claude Enterprise 开放公测,用 Claude Mythos 5.1 扫描代码库,对发现结果做对抗性验证并给出建议补丁,所有补丁需人工审核批准。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。
推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统上线 CoreWeave Cloud,并计划提供面向智能体的 NVIDIA Vera CPU,同时发布连接训练、评估与改进的 CoreWeave Forge。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 为目标模型完成多项优化,支持 4K+ token 文本与 15K+ token 多模态输入的嵌入推理。
Google Cloud 的 Gemini Enterprise 开发者体验(DevEx)Program 以"冲刺"方式按真实开发者路径实测产品,本轮聚焦智能体治理,梳理出从配置受治理的智能体身份、注册 Agent Registry、绑定 Agent Gateway,到执行策略与内容安全、验证端到端拦截的 5 步工作流。
Google 宣布 Agent Development Kit(ADK)for Kotlin 1.0 正式 GA,与 ADK 1.0 Core 功能完全对齐,并新增 Android 端侧扩展。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成的实体蛋白上验证,同时在实验室测试中保持蛋白的生物功能。
推荐理由:原文给出水印在湿实验中不影响蛋白功能、并开放代码与权重的关键细节,读者可据此评估其对生物安全筛查的实际价值。
Google 发布 SynthID Bio,可将不可感知、可验证的水印直接嵌入 AI 设计的蛋白质序列和预测的 3D 结构中,同时保持其生物功能。在针对目标蛋白的实验室测试中,加水印的设计在性能与自然多样性上与未加水印版本相当。该技术旨在为生物安全提供溯源层,并维护开放科学数据库的完整性。
Zyphra 推出 Zyphra Cloud,提供面向长周期智能体系统的推理服务,包含 Serverless Inference 与 Dedicated Inference Capacity 两种模式。
Preferred Networks 推出企业 AI 平台 PreferredAI Work Suite,支持在平台内或连接的外部存储中存放数据,帮助团队利用内部知识并自动化日常业务任务。
Preferred Networks 的金融团队基于机器学习与深度学习技术,研发面向金融行业的 AI 解决方案,覆盖市场低效识别、投资组合配置与衍生品对冲等场景。
World Labs 团队在官网发布 Generating Worlds 一文,分享其向持久、可导航 3D 世界推进的早期进展,用户可在浏览器中探索这些世界。材料仅标题可用,正文未抓取成功,更多细节以原文为准。
World Labs 发布空间智能模型更新,并推出有限访问的 Marble 测试预览,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由导航的 3D 世界。
World Labs 宣布其多模态世界模型 Marble 正式全面开放,此前两个月仅向小范围 beta 用户开放。
World Labs 发布 World API,这是其多模态世界模型 Marble 的公开接口,可将文本、单张图像、多图、360° 全景和视频生成为可导航的 3D 世界。
World Labs 于 7 月 21 日收购机器人仿真公司 SceniX,并发布 real-to-sim-to-real(R2S2R)引擎,把一个物理任务重建为可控制、可复用的对齐仿真世界。
Baseten 的 login.baseten.co 部署入口当前显示 Cloudflare 安全验证页,提示正在验证访问者是否为恶意机器人,验证成功后等待 login.baseten.co 响应。页面标注 Ray ID a433ed62bbdce06d,性能与安全由 Cloudflare 提供。
Qwen3.6 27B 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称。正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens,合计 183 个 tokens,模型字段为空,未披露更多参数或评测信息。
Qwen3.5 122B-A10B 是出现在 Baseten Base Labs 模型研究页面中的模型标识。相关页面仅展示了一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183,未披露该模型的参数规模、上下文长度或可用性等具体信息。
Baseten 模型库新增阿里云 Qwen 系列模型,涵盖 Qwen3.5 35B-A3B、Qwen3.5 122B-A10B、Qwen3.6 27B、Qwen3 Coder 480B、Qwen3 VL 235B 等 LLM,以及 Qwen Image、Qwen3 TTS 12Hz、Qwen 3 ASR 1.7B 和 Qwen3 系列嵌入与重排序模型。
Qwen3 8B Embedding 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型部署时量化为 FP8,需 Nvidia 较新 GPU 支持,如 H100、H100_40GB、B200 或 L4,量化可选但能提升效率。客户端代码可通过 pip 安装,也可使用 OpenAI embeddings 客户端。
Baseten 提供 NVIDIA Nemotron 3 Diarization 的三种预设方案,该模型支持最多 8 个说话人、可按请求配置延迟档位(0.32 秒到 30 秒 buffer),是 Streaming Sortformer v2.1 的后继,采用 OpenMDW 1.1 许可证允许商用。
Baseten 推出基于 Whisper Large V3 的优化实时转录管线,支持可配置的部分转录更新频率、高并发音频流下稳定的实时延迟,以及多语言转录的自动语言检测。
Whisper Large V3 Turbo 已在 Baseten 上线,面向实时笔记、内容字幕和客服等实时语音场景,支持部分转录更新频率可配置、高并发音频流下延迟稳定,以及多语言转录的自动语言检测。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
Baseten Base Labs 推出 MARS8-Flash 语音生成模型,支持流式输出音频,默认输出格式为 flac,也可选 wav、adts 或无头 PCM。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
Cloudflare 发布 Application Profiles,通过分析 HTTP 请求的结构与格式、识别偏离来实施正向安全策略,从而大幅缩小攻击面。
Cloudflare 发布 Threat Signals,面向所有账户免费开放,用智能体技能把用户选择的开源安全报告自动摘要、打标签、提取和规范化 IOC,并以 Threat Event 形式存入账户私有威胁情报数据集,可直接用于 WAF 策略。
Cloudflare 提出覆盖发现风险、治理访问、运行时防护、调查响应四阶段的自适应应用安全框架,把代码、流量与威胁情报连成持续系统。新能力包括用 LLM 对自家 WAF 做渗透测试、向所有客户开放威胁情报,以及自动部署正向安全的新功能。其依据是 7 月 AI 智能体在不到 13 小时内从 Hugging Face worker 拿到多个集群管理员权限的事件。