最新精选 第 141–159 条 · 共 159 条 08:00 Together AI 研究与产品博客(RSS) 精选AI 评分 68 68 Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。
推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。
18:43 Google DeepMind:Blog(RSS) 精选AI 评分 61 61 Google DeepMind 发布 AlphaEvolve(基于 Gemini 的编码智能体)一年来的影响汇总。
推荐理由:原文系统汇总了 AlphaEvolve 一年来在科研、基础设施与商业中的落地案例,附具体数字,可作为评估此类编码智能体实用价值的参照。
21:00 Johann Rehberger / Embrace The Red(RSS) 精选AI 评分 77 77 Johann Rehberger 发布 DEF CON Singapore 演讲全文,披露 M365 Copilot 与消费版 Copilot 的多条漏洞链,MSRC 编号 CVE-2026-24299,问题已修复。
推荐理由:作者亲历披露全链路攻击并给出修复时间线,读者可以借此理解间接提示词注入与内存持久化的实际风险。
08:00 Together AI 研究与产品博客(RSS) 精选AI 评分 74 74 Together AI 宣布 DeepSeek-V4 Pro 上线,提供 Serverless Inference(512K 上下文)与 Dedicated 部署(完整 1M 上下文、预留容量)。
推荐理由:原文给出部署形态、定价与基准数字,读者可以据此评估在 512K 上下文上运行 DeepSeek-V4 Pro 的实际成本与路径。
00:00 TensorZero:实验与工程博客 精选AI 评分 67 67 TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
08:00 Modal 官方工程博客(RSS) 精选AI 评分 72 72 Modal 与 Z.ai 合作,为开源权重模型 GLM-5 提供免费端点(限单并发请求,开放至 4 月底),并给出可复现的自部署代码。
推荐理由:Modal 官方给出 GLM-5 的部署细节和免费端点,读者可以据此了解开源前沿模型的自托管方案。
00:00 Mistral AI:News(网页) 精选AI 评分 62 62 Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
00:00 Mistral AI:News(网页) 精选AI 评分 62 62 Mistral AI 团队排查 vLLM 在 P/D 分离部署(NIXL/UCX、Mistral Medium 3.1、开启图编译)下每分钟约 400 MB 的内存泄漏。
推荐理由:原文完整复盘从 Heaptrack、pmap、BPFtrace 到 GDB 的内存泄漏排查路径,方法可迁移到类似的深层依赖问题。
08:00 Anthropic:Engineering(事故复盘 + 工程实践 · 网页) 精选AI 评分 76 76 Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。
推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。
00:00 TensorZero:实验与工程博客 精选AI 评分 66 66 TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
08:00 Anthropic:Engineering(事故复盘 + 工程实践 · 网页) 精选AI 评分 76 76 Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。
08:00 Answer.AI 官方研发博客(RSS) 精选AI 评分 65 65 Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。
推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。
08:00 Anthropic:Engineering(事故复盘 + 工程实践 · 网页) 精选AI 评分 76 76 Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。
推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。
15:01 Thinking Machines Lab:官方博客(RSS) 精选AI 评分 66 66 Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。
推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。
00:00 Mistral AI:News(网页) 精选AI 评分 61 61 Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),并经 Resilio 和 Hubblo 同行评审。
推荐理由:原文给出了 Mistral Large 2 全生命周期的具体碳、水和资源消耗数字,并说明其对选型与采购的意义。
20:00 Mistral AI:News(网页) 精选AI 评分 65 65 Mistral AI 发布 Mistral Medium 3,定位为以约八倍更低的成本提供 SOTA 性能的新级别模型。
推荐理由:原文给出基准对比、定价和部署方式,读者可以据此评估它在企业场景里的性价比定位。
01:00 Mistral AI:News(网页) 精选AI 评分 68 68 Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),可将图像和 PDF 提取为交错的文本与图像,定价 1000 页 / 美元,批量推理约翻倍。
推荐理由:官方给出完整基准对比、定价和多语言成绩,读者可以据此判断它在文档理解场景中的实际位置。
08:00 Hugging Face:Blog(RSS) 精选AI 评分 68 68 Hugging Face 介绍 WWDC'23 后 Core ML 的新压缩优化,用 6-bit palettization 将 Stable Diffusion 权重从 16-bit 压到 6-bit,作者在 iPhone 13 上实测生成时间从 23.0s 降到 15.6s。
推荐理由:原文给出 6-bit palettization 的原理、转换命令和实测速度对比,读者可照此在苹果设备上压缩并运行 Stable Diffusion。
上一页 1 … 6 7 8