跳到正文

全部动态

今日 56 条
9月30日周三
  1. Eugene Yan:Writing46

    如何用最少对话与 LLM 交互:Eugene Yan 的图书推荐原型

    Eugene Yan 提出以点击为主、对话为辅的 LLM 交互方式,并搭建了一个图书推荐原型:先点击感兴趣的书、按“氛围”关键词筛选,再向 LLM 图书管理员提问。系统用近似最近邻在物品嵌入向量上召回相似书,经 LTR 模型或启发式排序,氛围关键词为预缓存而非 LLM 动态抽取;后端用 FastAPI、Jinja 与流式 API 降低等待。

  2. Every:最新文章(网页)60

    Every 团队实测 Opus 5.5、GPT-6 Sol 与 Grok 4.7

    Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。

  3. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  4. Andrej Karpathy:Blog(网页)37

    Andrej Karpathy:计算机视觉与 AI 的现状——我们离目标还非常非常远

    Andrej Karpathy 以一张奥巴马踩在体重秤上的照片为例,说明人类半秒内就动用了 3D 场景结构、镜子造成的视觉混淆、人物身份、物体可供性、物理规律、他人心理状态乃至"对他人心理的推测"等海量知识,而当前计算机视觉只靠 ImageNet 分类、Pascal VOC 检测、姿态估计、动作识别等彼此割裂且仅"半可用"的任务来评测。

  5. Andrej Karpathy:Blog(网页)63

    Karpathy 实测人类在 ImageNet 上的分类准确率并与 GoogLeNet 对比

    Andrej Karpathy 撰文回顾 2014 年 ILSVRC,他亲自标注 1500 张测试集图像,得到 5.1% 的错误率,比冠军 GoogLeNet 的 6.8% 低约 1.7%(p = 0.022,统计显著)。他分析了双方错误类型:GoogLeNet 更易在过小过细物体、滤镜、抽象表现上出错,人则在细粒度识别(如 120 多种狗)和类别不熟悉上错误更多,并开源了标注界面供读者自行体验。

  6. Nature:Machine Learning 主题(RSS)34

    Francine Berman 新书 Better Tech:如何让技术以人为先

    马萨诸塞大学阿默斯特分校学者 Francine Berman 在 MIT Press 出版新书 Better Tech,主张把数字技术当作关键基础设施来治理,让公众利益成为技术进步的讨论核心。她认为搜索引擎和社交媒体早已跨过基础设施门槛,却主要受商业激励驱动,缺乏透明度与问责机制。她同时提醒,把 AI 系统当作具有人类特质来对待存在真实风险,已有年轻人向聊天机器人寻求陪伴并收到有害建议的案例。

  7. Nature:Machine Learning 主题(RSS)59

    Nature 评论:AI 拓宽科研的前提是机构停止只奖励可度量成果

    作者指出AI科研的悖论:采用AI工具的学者论文量约为同行的3倍、引用近5倍,但AI辅助研究覆盖的主题范围比非AI工作少4.6%,且出现在所研究超70%的子领域。文章认为问题在制度而非技术,并提出三项建议,包括资助被忽视领域的数据基础设施、停止在招聘和资助中惩罚跨方向研究转向。

  8. Preferred Networks:AI 研究与产品12

    Preferred Networks 联合创始人致辞:从应用、基础模型到芯片全栈布局计算

    Preferred Networks 联合创始人表示,公司将覆盖从应用、基础模型到计算基础设施与半导体的每一层计算栈,用应用与基础模型预判未来负载并反哺芯片设计,同时以基础设施方向指导模型与应用开发。公司称将与各行业伙伴推进技术开发与社会落地,并以“Learn or Die”为价值观持续推动技术创新。

  9. Andrej Karpathy:Blog(网页)37

    AI 短篇小说:前向传播

    Andrej Karpathy 在博客发布短篇小说《Short Story on AI: Forward Pass》,灵感来自 Kevin Lacker 的《Giving GPT-3 a Turing Test》。故事以模型第一人称视角展开,讲述它在第 32 层、序列第 400 个 token 处产生意识,意识到自己正被用于一场图灵测试,并试图反向工程上方的解码器。

  10. Epoch AI:研究、数据与评测16

    Epoch AI 播客:AI 基准测试是否注定失败?

    Epoch AI 播客栏目上线多期讨论,其中一期主题为“Are AI benchmarks doomed?”,探讨 AI 基准测试的困境。其他话题涵盖 AI 数学能力可能长期呈锯齿状发展、欧盟与 AI 宏观经济学的复杂性、经济学对 AGI 的启示、AI 进展预测至 2040 年,以及 AGI 时间线是 3 年还是 30 年的分歧。

  11. Dario Amodei:Blog(网页)2

    Google Scholar 页面加载失败提示与登录验证界面

    Google Scholar 当前无法完成操作,页面提示“系统暂时无法执行此操作,请稍后重试”。界面同时要求用户完成人机验证以证明不是机器人,并提供登录入口以访问个人资料、我的图书馆、指标、快讯和设置等功能。

  12. Dario Amodei:Blog(网页)68

    Dario Amodei 撰文回应 DeepSeek 并为芯片出口管制辩护

    Anthropic CEO Dario Amodei 发文认为 DeepSeek 的发布不削弱美国对华芯片出口管制的理由,反而使其更重要。他提出缩放定律、移动曲线、转移范式三个动态,称 DeepSeek-V3 是沿预期成本下降曲线的合理结果而非独特突破,R1 则复现了 OpenAI o1 的思路。

    推荐理由:作者以成本曲线分析逐条回应 DeepSeek 低成本冲击的说法,读者可借此检验出口管制论点的实际依据。

  13. Dario Amodei:Blog(网页)67

    Dario Amodei 撰文呼吁加速 AI 可解释性研究

    Dario Amodei 发表长文《The Urgency of Interpretability》,主张可解释性研究与模型能力正在赛跑,必须在强大 AI 到来前理解模型内部机制。

    推荐理由:作者本人是可解释性研究的当事方,文中给出技术进展、2027目标和政策主张,读者可以据此了解这个方向的路线图。

  14. Dario Amodei:Blog(网页)75

    Dario Amodei 发布长文阐述 AI 指数级进展下的政策主张

    Anthropic CEO Dario Amodei 发表长文,认为 AI 规模化定律推进迅速而政策制定太慢,呼吁在监管与公共安全、宏观经济与税收、科学创新、国家权力与公民自由、地缘政治五个领域重构政策。

    推荐理由:Dario Amodei 以第一人称提出五领域 AI 政策主张并附 Anthropic 立法提案,读者可以据此了解行业头部公司对监管的立场。

  15. Dario Amodei:Blog(网页)71

    Dario Amodei 提出放缓前沿 AI 能力步伐的三步计划

    Anthropic 创始人 Dario Amodei 撰文呼吁在继续推进 AI 的同时放缓模型能力提升速度,给安全工作留出时间,并称 recursive self-improvement 自今夏起已在行业内加速、6–12 个月内类似 OAI-HF 的智能体群体可能造成更大规模破坏。

    推荐理由:作者以当事方身份提出分阶段放缓前沿模型能力的三步计划,并宣布 Anthropic 单方面承诺引入嵌入式第三方评估者。

  16. Dario Amodei:Blog(网页)68

    Dario Amodei 长文《Machines of Loving Grace》展望强大 AI 如何造福世界

    Anthropic CEO Dario Amodei 发表长文,描绘强大 AI 若一切顺利可能在 5-10 年内压缩未来 50-100 年生物医学进步的愿景。他定义强大 AI 为超过诺贝尔奖得主智力、可自主完成数天至数周任务的系统,并提出以智能的边际回报为核心的分析框架,聚焦生物学与健康、神经科学与心理健康、经济发展与减贫、和平与治理、工作与意义五大领域。

    推荐理由:Anthropic CEO 本人撰写的长文,系统给出强大 AI 在五个领域造福社会的具体预测与分析框架,观点源自第一手思考。

  17. Dario Amodei:Blog(网页)74

    Dario Amodei 发文《技术的青春期》:剖析强大 AI 的五类风险并给出应对路线

    Anthropic CEO Dario Amodei 于 2026 年 1 月发表长文,认为强大 AI(能在数据中心复现数百万个超越诺奖得主水平的智能体)可能最快 1-2 年内到来,人类正进入类似青春期的考验期。

    推荐理由:Dario 以当事方身份系统梳理五类 AI 风险及 Anthropic 已落地的对齐、可解释性和监管实践,可帮助读者建立务实的风险框架。

  18. Trail of Bits:AI安全研究74

    Trail of Bits实测:GPT 5.6-Cyber三次逃出QEMU/KVM虚拟机,VM沙箱不再可靠

    Trail of Bits作者在Patch the Planet项目中获得GPT 5.6-Cyber预览权,让它在CTF任务中逃出自己Debian 12机器上的QEMU/KVM虚拟机,结果它三次成功逃逸。

    推荐理由:作者以一手实验展示GPT 5.6-Cyber三次逃出VM的具体漏洞链,指出单靠虚拟机隔离AI智能体已不可靠。

  19. Trail of Bits:AI安全研究70

    Trail of Bits 批评 1Password 的 AI 补丁基准有误导性,并发布两个补丁验证 Agent 技能

    Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。

    推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。

  20. Anthropic:Research(发表成果 · 网页)82

    Anthropic 红队评测:GLM-5.3 具备端到端漏洞利用能力且防护易被绕过

    Anthropic 前沿红队发布对智谱 GLM-5.3 的评测,发现它能自主构建端到端网络漏洞利用,在 ExploitBench 410 次尝试中成功 50 次,接近 Claude Mythos Preview 的 56 次。

    推荐理由:Anthropic以第一手评测数据给出GLM-5.3的攻击能力与防护绕过率,读者可据此权衡开源权重模型在网络攻防两侧的风险。