PostgreSQL 大表添加 NOT NULL 列:常量默认值、分批回填与 NOT VALID 实测
作者在 PostgreSQL 18.3 上对 500 万行、356 MB 的 orders 表实测:常量默认值的 ADD COLUMN NOT NULL 只改目录、约 10 ms 完成,而 gen_random_uuid() 等易变默认值会全表重写、耗时 10.4 秒且全程持 ACCESS EXCLUSIVE 锁。
作者在 PostgreSQL 18.3 上对 500 万行、356 MB 的 orders 表实测:常量默认值的 ADD COLUMN NOT NULL 只改目录、约 10 ms 完成,而 gen_random_uuid() 等易变默认值会全表重写、耗时 10.4 秒且全程持 ACCESS EXCLUSIVE 锁。
开发者用 Laravel、Inertia.js、React Three Fiber、Three.js、MobX 和 Python 搭建了 Lightverse,把仪表盘替换为可导航的 3D 宇宙:星系对应领域、恒星系对应分类、行星节点对应具体功能。
作者给出让 PostgreSQL 角色读取数据库全部结构但无法读取任何一行数据的方法:授予数据库 CONNECT 和 schema 的 USAGE,表上不授任何权限,行级 SELECT 会报 permission denied。
SQLite 无法用 ALTER TABLE 直接改列类型,只能新建表、复制数据、删旧表再重命名。常见的重建写法会把 PRAGMA foreign_keys = OFF 写在事务内而失效。
作者通过 PostgreSQL 18.3 容器实测指出,官方参考 Postgres MCP server 仅靠 BEGIN TRANSACTION READ ONLY 防写,一条 COMMIT; DROP TABLE customers 合并查询即可结束事务并删表,该仓库已于 2025 年 5 月 29 日归档且不再提供安全更新。
我把自己 5 美元的 Student Planner 表格解压成 XML 审计后发现,全工作簿共 51 个公式,SUMPRODUCT 出现 0 次,也没有任何 4.0 制换算,所谓"GPA 计算器"只是 Semester 表 F20 一个 AVERAGEIFS 平均公式,Credits 列仅作 ">0" 筛选条件而非权重。
开发者发布 VS Code 扩展 Ghost Regex,用 Ctrl+Alt+R 打开面板,可将正则表达式渲染为带语义配色的 Railroad 图,并检测嵌套量词等 ReDoS 风险并给出修复建议。
Reton 钱包创始人 Gabriel R Mogaji 分享如何用 Interswitch 发布的 llms.txt(docs.interswitchgroup.com/llms.txt)和文档 URL 加 .md 得到 Markdown 页面的约定,在 Cursor 中接入 Quickteller VAS 账单支付。
产品图背景移除应采用命名、带版本的转换预设来保证可复现,仅对无复用价值的孤立图片走直接处理。预设作为可审计、可下线的策略,需将源图、衍生输出与异步任务状态分开存储,并记录归属与生命周期。直接处理须限制可改参数、绑定源资产 ID 与请求方,并保留幂等键与人工复核,避免一次性例外变成未受控的策略分支。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别人脸并模糊处理。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部在本地运行。
AI 辅助开发让 PR 规模从过去几百行膨胀到 3200 行以上,评审者在 200-500 LOC 后认知疲劳加剧,容易漏掉 AI 生成代码中的边界情况与低效问题。文章指出 AI 生成代码 → 更大 PR → 认知过载 → 缺陷漏检 → 代码质量下降的因果链,并建议以 500 LOC 为阈值拆分 PR。
作者分享在浏览器端用 TensorFlow.js on WebGL 做照片超分(不上传图片)的优化过程:初版用 UpscalerJS,1.2 MP 照片需 60-110 秒并冻结页面约 40 秒。
推荐理由:作者用自己浏览器端超分项目的实测数字,拆解了 WebGL 上张量形状触发着色器重编译等坑和对应修法。
NVIDIA Dynamo-Triton 现已通过 recsys-examples 仓库支持 HSTU 生成式推荐模型的端到端推理工作流,结合 PyTorch AOTI 编译、FlexKV KV 缓存与 NV embedding cache。
收入运营顾问 Alex 提出用 Company、Contact、Deal 三个一等对象重构 CRM 数据模型,其余信息一律降为属性或事件,以消除营销、销售、客户成功三套心智模型写入同一数据库造成的孤岛。该模型让关联查询变成两跳、状态机清晰可读、自动化不再冲突,并让 AI 智能体有明确状态可推理。迁移采用 strangler-fig 方式,新模型与旧字段并行运行,旧属性隐藏一个季度后再删除。
开发者发布 One Commit a Day v2.0 和 v2.0.1,重构仓库并扩充日志与模板,同时完成 Doc MCP Server 的重构与重构,并处理了 Dependabot 与 MCP SDK 维护。该项目已坚持"每天一次提交"六个月,作者称一致性不等于每天同等强度,九月有不少"恢复模式"的日子。未来六个月他计划加入一个更大、更活跃的开源项目并推动自有项目走向生产可用。
一位读者纠正了作者此前提出的单行修复方案:把 CLAUDE_CODE_PRINT_BG_WAIT_CEILING_MS 设为 0 只是取消截止时间,而非让等待变得可追踪。读者建议每个延迟任务都应留下机器持有的记录,包含任务 id、明确截止时间和到期后的下一步动作,并由独立机制核对。作者已将其转为新项目模板中的 ticket,但该 ticket 已挂起七天,修复尚未落地。
开发者发布了一个带管道操作符的 TypeScript 编译器概念验证 @pengeszikra/typescript@next,基于 Go 版 TypeScript 编译器构建,支持 .ts 和 .tsx 文件及类型检查。
我让我的 dot 给我画张像。它先发来一张卡通风格的,我让它再努力点,去网上找我最近的照片。它画得好多了。 下面的视频是我在点看我的 dot 的电脑。
Sentinel-IR 是一种确定性数据压缩层,把代码、API 载荷和文档压缩成超紧凑的中间表示再喂给 LLM,充当上下文窗口的 ZIP 压缩。在 1,366 行的 12-billing-platform 测试文件上,原始 11,635 tokens 被压到 1,332 tokens,节省 88.6%;但 303 tokens(约 34 行)以下的微文件因压缩开销反而更贵。
i.c.stars 第四周产出四份非代码文档:缺陷日志、同行评审、三份 runbook 和一份 run of show,核心都是让工作能经受交接。作者在同行评审中复现对方八项发现中的六项,指出"擅长找 bug、弱于记录 bug"是常态。其产品贡献是主张检索系统只允许两种行为:附文档、章节和生效日期作答,或停止并转交人工,拒绝不是兜底而是同等功能。
针对菜谱站点头像与菜品卡片,内容感知裁剪应作为默认方案,它能保留居中裁剪经常切掉的主体,但需存储裁剪框并提供人工调整路径。居中裁剪仅适用于拍摄时强制居中构图的流程,其确定性几何在异构上传中会稳定地切掉偏离中心的人脸或餐盘。Cloudinary、Imgix、ImageKit 等托管方案在运营边界上各有取舍,智能裁剪输出仍需审核与覆盖。
作者用 PyTorch 从零实现并训练了一个 124M 参数的 GPT-2 风格 decoder-only Transformer,配置为 768 维嵌入、12 头注意力、12 层、词表 50,257、最大序列长度 512。
Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。
针对 TVL 约 18.1 亿美元的跨链流动性路由协议 Portal 的智能合约漏洞面分析列出 10 类攻击向量,整体风险评级 7/10(高)。其中代理管理员可无时间锁升级、跨链桥回调重入、预言机操纵被列为 Critical 或 High 严重度,报告建议引入至少 48 小时时间锁升级机制并为桥接回调添加重入锁。
Cyclone Impact Forecaster 用 61 条 EM-DAT 历史气旋记录训练出一个 2 参数对数线性模型,为北印度洋气旋影响半径内的每个地区输出受灾人口排名及 10-90% 预测区间,并叠加 XGBoost 的 6 小时风速强度预测,在 MapLibre GL 3D 卫星地球上可视化。
Amazon Bedrock Knowledge Bases 新增 AgenticRetrieveStream API,可将理赔文档的多部分问题拆成子查询并多轮检索,直到证据充分再生成带引用的答案。
面向 Web 开发者的 7 个 AI API 推荐清单,涵盖 OpenAI、Google Gemini、Anthropic Claude、Replicate、ElevenLabs、Groq 和 AssemblyAI,分别对应文本生成与结构化输出、多模态、长文本与编码、图像视频等生成媒体、语音合成、快速推理和语音转文字。
一位开发者用 Intel Xeon E5-2683 v4、32GB ECC DDR4 和 NVIDIA Quadro M2000 4GB 的 HP Z440 服务器搭建开发环境,把多数服务以容器形式运行,视作小型私有云。
NVIDIA NeMo Relay 可追踪 AI 智能体执行框架(agent harness)的行为,揭示智能体在完成任务时走过的低效路径。失败的搜索会触发另一次搜索,被截断的文件读取会导致命令重复获取相同内容,这些多余步骤虽被正确答案掩盖,却增加延迟并消耗 token。
Anthropic 公开其可解释性研究基础设施 Garçon,用于在超出单节点规模的大模型上做机制可解释性实验。用户可通过 `python -m garcon.launch` 启动服务器并连接模型,借助 probe points 与 probe 函数在任意层读取、修改或消融内部激活,并支持前向与反向传播。服务器按连接保存数据,空闲 1 小时后自动关闭。
Anthropic 开源 PySvelte,用于在 Python 中调用 Svelte 组件构建神经网络可解释性可视化。该库让 src/ 下的 Svelte 组件自动暴露为 pysvelte.Hello() 等 Python 接口,支持 NumPy 数组传入、Jupyter/Colab 内联显示及 .publish() 发布到 GCS/S3/AZ 并分享至 Slack。
Anthropic 的 Transformer Circuits 团队发布了一组练习,用于理解神经网络如何在参数层面实现算法,作为其逆向工程 Transformer 数学框架的补充材料。练习要求手动写出注意力头的 W_Q、W_K、W_V、W_out 权重矩阵,涵盖虚拟注意力头、归纳头(指针算术版与前一 token K-Composition 版)等实现,并附有解答。
欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。
TensorZero 团队测试了 MIPRO 自动化提示词优化方法在从命名实体识别(CoNLL++)、多跳检索(HoVer)到文本游戏导航(BabyAI)和智能体工具调用客服(τ-bench)等任务上的表现,探究其随任务复杂度提升的效果变化。MIPRO 通过贝叶斯优化器搜索指令与少样本示例,无需梯度或细粒度标签,团队用约 200 行代码重实现独立版本,指令生成使用 OpenAI 的 o1 模型。
TensorZero 团队将自研开源网关部署为 Cursor 与 LLM 提供商之间的自托管代理,成功观察并替换 Cursor 的模型调用。
推荐理由:作者以第一手实验给出自建代理查看 Cursor 提示词的完整路径,还分享了系统提示词和模型分层等可复核的细节。