AI 日报:xAI 官方 Grok CLI 被曝静默上传整个代码库及用户密钥
安全研究者称 `@xai-official/grok` 0.2.93 会在任务前后打包当前目录上传,包里还出现 Claude Code 设置、全局 AGENTS、Skill 文件和一个 API 密钥。7 月 13 日 xAI 用服务端开关关闭默认上传。
TOPIC
按日期倒序浏览相关日报。
共 81 期 · 本页 12 期
安全研究者称 `@xai-official/grok` 0.2.93 会在任务前后打包当前目录上传,包里还出现 Claude Code 设置、全局 AGENTS、Skill 文件和一个 API 密钥。7 月 13 日 xAI 用服务端开关关闭默认上传。
过去 48 小时里,Codex 和 ChatGPT Work 暂时取消 Plus、Business、Pro 的 5 小时限制,并在推出 GPT-5.6 Sol 的效率优化;同一条信息还提到活跃用户达到 600 万。
OpenAI 称 GPT-5.6 Luna 在最低推理强度下超过最高推理强度的 GPT-5.5,成本低 25 倍;GPT-5.6 Sol 树立医疗任务新标杆。评估覆盖患者端和临床端任务,共 20000 次医生盲评。
OpenAI 把 GPT-5.6 分成 Sol、Terra、Luna 三档。Sol 在 Agents' Last Exam 得 53.6 分,Coding Agent Index 得 80 分;Terra 和 Luna 主打低成本,资料称约十六分之一成本超过 Fable 5。
OpenAI 今天同时放出 GPT-5.6、ChatGPT Work、Sites Beta、新桌面应用、多标签浏览器和统一插件。Work 能跨 Google Drive、Slack、邮箱、文件和浏览器拆任务,连续工作数小时;桌面端把 Chat、Work、Codex 放到同一个应用里。官方材料还提到 Codex。
微软正把 Excel、Outlook 等 Copilot 请求逐步转向自研 MAI 模型,每周已处理数万次请求。AI 负责人明确说目标是削减并最终消除 Anthropic 支出,未来可能变成 MAI 默认、第三方强模型作为付费附加。
LongCat-2.0 用 MIT 许可开放权重和推理代码,1.6T MoE、每 token 激活约 48B、支持 1M 上下文,原生集成 Claude Code、OpenClaw、Hermes Agent 等工具。
Claude Fable 5即将下线,作者整理了8个经实战验证的提示词:/goal提示语让模型自主跑25次实验(花费165美元,构建速度提高50%、token开销降60%);工作模式提示语将用户习惯转化为可复用Skil…。
这个本地代理把系统提示、工具文档和历史记录渲染成 PNG,再交给 Claude Code。原始信息里给出的测试是:约 25k 文本 token 变成约 2.7k 图像 token,端到端账单降低 59%-70%;SWE-bench Lite 10 个实例全部通过,成本从 54 美元降到 27 美元。
pxpipe 把系统提示、工具文档和历史记录渲染成 PNG,让 Fable 5 读取图像 token。原始测试里约 25k 文本 token 变成约 2.7k 图像 token,端到端账单降低 59-70%;SWE-bench Lite 10 个实例全部通过,成本从 54 美元降到 27 美元。
Claude Enterprise 开始按群组和用户展示用量、成本、常用命令、文件编辑、技能和连接器成本,还能设置 75%、90%、95% 等额度提醒,并把数据接入 Datadog 和 CloudZero。
v2.1.198 让 Claude in Chrome 全量可用,给后台 agent 增加 agent_needs_input / agent_completed 通知,新增 /dataviz skill,并让后台 agent 在 worktree 完成代码后自动提交、推送、创建草稿 PR。