GPT‑Live 发布
6.5OpenAI 终于升级了 ChatGPT 语音模式所使用的基础模型,推出了 GPT‑Live。新模型表现令人印象深刻,还能将复杂任务转交给 GPT-5.5 处理。作者在预览期间遇到一个奇怪的 bug:模型会在他没讲笑话时打断他发笑,感觉有些冒犯,不过据反馈 OpenAI 已做了调整。最长的对话是在遛狗时持续了整整一小时,但至今仍未拍到猫头鹰的照片。
30 条来自 simonwillison-net 的内容
OpenAI 终于升级了 ChatGPT 语音模式所使用的基础模型,推出了 GPT‑Live。新模型表现令人印象深刻,还能将复杂任务转交给 GPT-5.5 处理。作者在预览期间遇到一个奇怪的 bug:模型会在他没讲笑话时打断他发笑,感觉有些冒犯,不过据反馈 OpenAI 已做了调整。最长的对话是在遛狗时持续了整整一小时,但至今仍未拍到猫头鹰的照片。
凯顿·瓦尔达宣布禁止其团队使用AI编写变更描述(如PR、提交消息及工单)。他指出,AI生成的内容充斥着代码细节的罗列,却缺失理解代码整体意图所需的高层框架,这对审查PR毫无帮助,甚至适得其反。
sqlite-utils 4.0 正式发布,这是自 2020 年 11 月 3.0 版本以来的首次主版本更新。新版本引入了三大核心特性:数据库模式迁移(支持通过 Python 文件定义和执行 schema 变更)、嵌套事务(通过新的 db.atomic() 方法实现)、以及复合外键支持。此外,该版本还包含了若干破坏性变更,如升级了 upsert 语法、修改了 db.query() 的执行逻辑等。开发者 Simon Willison 表示,Claude Fable 5 等 AI 模型在代码审查和问题发现中发挥了关键作用,显著提升了本次发布的质量。
腾讯发布了新一代 Apache 2.0 开源模型 Hy3,这是一款拥有 2950 亿参数的混合专家(MoE)模型,其中 210 亿为活跃参数,并包含 38 亿 MTP 层参数。该模型在性能上超越了同等规模模型,可与参数规模大 2-5 倍的旗舰开源模型媲美。完整模型文件达 598GB,FP8 量化版本为 300GB,支持 256K 上下文长度,并在 OpenRouter 上提供免费试用至 7 月 21 日。
sqlite-utils 4.0 的第三个候选版本。作者原计划发布正式版,但在处理积压问题时不断新增功能,其中最重要的是支持复合外键的 introspection 与创建,这涉及对 table.foreign_keys 的轻微破坏性变更。此外,该版本现在也遵循 SQLite 的不区分大小写列名约定。
《2026年6月赞助者专属通讯》已发布。本期内容包括:Claude Fable 5、GPT-5.6与美国出口限制;GLM-5.2成为最佳开放权重模型;Tokenmaxxing热潮退去;Datasette应用及sqlite-utils、shot-scraper相关更新;各类WASM项目及其他模型发布动态。赞助者(月费10美元)可提前一个月阅读,非赞助者可查阅5月通讯预览。
Simon Willison 发布了 llm-coding-agent 0.1a0,这是一个基于其 LLM 库构建的简单编码代理实验。该代理具备文件读写、命令执行、搜索等工具集,支持通过 `uvx --prerelease=allow --with llm-coding-agent llm code` 命令运行,并提供了 Python API 接口。GPT-5.5 已成功使用该代理生成了一款 ASCII 艺术时钟的 SwiftUI CLI 应用。
Simon Willison在AIE主题演讲的启发下,尝试使用DSPy框架来评估和优化Datasette Agent的SQL系统提示词。他通过Claude Code和Claude Fable 5发起异步研究任务,Fable选用GPT 4.1 mini和nano进行测试,发现了多个改进方向。其中一个关键发现是:当前提示词中只列出了表名而未包含列名,加上"已掌握信息就不要调用describe_table"的建议,导致模型猜测列名(如page_count、o.order_id、first_name)并陷入错误重试循环。解决方案是在提示词的模式描述中直接包含列名,或软化相关建议。
Simon Willison 分享了 Geoffrey Litt 在 AIE 大会上提出的"理解才能参与"观点。Litt 认为,在与编码 agent 协作构建越来越复杂的大型变更时,必须深入理解代码才能有效参与创作过程。如果缺乏对代码的透彻理解,认知债务会不断累积,最终严重限制你在项目中的参与和创造能力。
Anthropic 发布消息称,美国商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。公司将于明天开始恢复访问权限,并将尽快分享后续更新。
Claude Sonnet 5 于今早发布,性能接近 Opus 4.8 但价格更低。新版取消了 temperature、top_p、top_k 等采样参数,默认启用自适应思考(Adaptive Thinking),并采用了新的分词器——同一文本产生的 token 数比 Sonnet 4.6 增加约 30%,相当于隐性提价 30%。英文文本 token 成本增加约 1.4 倍,西班牙语 1.33 倍,Python 代码 1.28 倍,简体中文基本不变。
Nano Banana 2 Lite(亦称 Gemini 3.1 Flash Lite Image)是 Google DeepMind 推出的"最快、最便宜的 Gemini 图像模型",专为速度和规模而设计。作者使用 AI Studio 让它生成一张"沃利在哪里"风格但主题为"浣熊拿着业余无线电在哪里"的图片,结果比今年四月尝试的其他 Nano Banana 模型效果更好,不过它将"森林节"拼错了两次。
一款政治罗盘风格的性格测试工具,通过回答 29 个关于 AI 与 AI 伦理的问题,将用户归类为 30 种原型之一。作者第一次测试就被归类为“车库工匠”,其守护圣徒竟然是 Simon Willison 本人。该工具采用单页 React 应用实现,使用 <script type="text/babel"> 技巧省去了构建步骤。
shot-scraper 1.10 发布,主要新功能为 shot-scraper video storyboard.yml,可用于录制视频演示。详情请参阅《让您的代理通过 shot-scraper video 录制工作视频演示》一文。
shot-scraper 1.10 新推出的 shot-scraper video 命令,可接受一个 storyboard.yml 文件定义对 Web 应用的操作流程,并借助 Playwright 录制视频。该功能由 GPT-5.5 在 Codex Desktop 中编写,YAML 格式也由编码智能体定义并用 Pydantic 验证。作者认为这是一种让编码智能体自动生成产品功能演示的有力模式。
又一个来自 Simon Willison 的粘贴转换工具。该工具可接受浏览器中复制的富文本(含嵌入式 HTML 表格),并将其中的每个表格自动转换为 HTML、Markdown、CSV、TSV 或 JSON 格式。用户只需从维基百科页面复制全部内容并粘贴到工具中,即可在多种格式间自由切换查看和导出数据。
一则极简的 TIL 技巧:使用 AppleScript 统计 Safari 浏览器中打开的标签页数量。在终端运行一行命令即可返回所有窗口中的标签页总数,例如本例中显示多达 370 个标签页。
DeepReinforce 发布了首个开源模型 Ornith-1.0(MIT 许可),基于 Gemma 4 和 Qwen 3.5 构建,提供 9B、31B、35B MoE 和 397B MoE 四种变体,在编程基准测试中达到同规模开源模型的顶尖水平。作者在 LM Studio 中运行 35B 量化版(20GB),配合 Pi 工具使用,发现该模型在处理多轮工具调用时表现优异,并能轻松完成查询代码库和绘图等任务。
西蒙·威尔逊介绍了"Hack Your Summer"计划,这是一个为期四周的高强度生产冲刺项目,面向本科生、研究生和应届毕业生。该计划部分是对今年美国大学生实习危机的回应——由于企业减少招聘且团队指导能力下降,可用实习岗位远少于往年。Hack Your Summer为那些未能获得稀缺实习机会的学生提供了一条替代路径。第二期(免费)将于7月13日开始,学生申请截止日期为7月8日,同时也在招募志愿者担任导师。