跳到正文
AI Dayline · AI 独立开发者日报
← 返回日报归档

2026年7月10日星期五

AI 日报:OpenAI 推出 GPT-5.6、ChatGPT Work、Sites,并把 ChatGPT 和 Codex 合进桌面应用

OpenAI 今天同时放出 GPT-5.6、ChatGPT Work、Sites Beta、新桌面应用、多标签浏览器和统一插件。Work 能跨 Google Drive、Slack、邮箱、文件和浏览器拆任务,连续工作数小时;桌面端把 Chat、Work、Codex 放到同一个应用里。官方材料还提到 Codex。

30 秒速读

本日报从公开来源中筛选与独立开发者相关的模型、产品、需求和工作流变化。事实链接用于核对,价值判断是编辑分析。

今天最该知道的 10 条

OpenAI 推出 GPT-5.6、ChatGPT Work、Sites,并把 ChatGPT 和 Codex 合进桌面应用 原文

GPT-5.6 分成 Sol、Terra、Luna,模型选择开始变成成本工程 原文

CursorBench 上 GPT-5.6 Sol 接近 Fable 5 Max 表现,但成本低很多 原文

ChatGPT Sites 把对话里的可视化、小工具和页面变成可发布网站 原文

微软 Flint 把 agent 生成图表变成可编辑的中间语言 原文

GitHub 和 Product Hunt 同时出现一批 agent 工具层项目 原文

Google LiteRT.js 让浏览器端 AI 推理更像正式开发选项 原文

Ollama 开发者数达到 890 万,本地模型已是主流分发入口 原文

OpenAI 审计 SWE-Bench Pro:约 30% 任务有缺陷 原文

AI 生成内容正在污染社交平台,LinkedIn 长文尤其明显 原文

大模型榜单异动

今天 Artificial Analysis 里没有 major_surgewatch 级别异动,只有 22 个 minor_change。Dreamina Seedance 2.0 720p 继续在 Video/Image-to-Video 和 Video/Text-to-Video 排第 1,HappyHorse、Kling、SkyReels、Veo、Wan、GPT Image 2、Mureka、Suno 等只有小幅 Elo 或名次变化。

判断:今天不应该因为榜单变化就更换默认模型。更值得实测的是 GPT-5.6 的三档路由、成本和长任务表现,以及它在具体产品工作流里的总完成成本。

值得注意的新产品、新方向、新模型

蚂蚁灵波开源 LingBot-World 2.0 和 LingBot-Video 原文

NVIDIA Nemotron-Labs-3-Puzzle-75B-A9B 用压缩换吞吐 原文

TeXada 做本地优先数学 agent 原文

未被满足的需求

长任务 agent 太费钱、太费额度、太吃机器资源,用户需要任务级体检

企业和个人都需要 agent 交付验收,而不是只看“模型说完成了”

非开发者开始用 agent 做文档、表格、报告,但 Office 文件自动化仍然很粗糙

如果今天只有两个小时

做一个“Agent 成本体检器”的极小 MVP。

输入先限制成一个场景:用户上传 Cursor、Claude Code、Codex、OpenRouter 或自己服务端的一段运行日志。输出四件事:这次任务用了哪些模型、每一步花了多少 token 和钱、哪里发生了重试或长时间等待、下一次哪些步骤可以换便宜模型或加缓存。不要先做自动路由平台,先做诊断报告。

第一批用户去 X 上找抱怨 GPT-5.6、Grok、Claude Code、Cursor 用量和速度的人,也去 HN、Indie Hackers、OpenRouter/LLM 工具社区找已经在跑 coding agent 的独立开发者。卖点很直白:一次任务到底贵在哪里,下一次怎么少花钱。

原始信息

以下公开来源链接用于核对本期事实;来源收集数量保留为编辑透明度说明。本次采集:AI HOT 精选 32 条,AI 新闻 66 条,GitHub 趋势 52 条,Product Hunt 33 条,X 45 条,抓取异常 0。