
GPT-6.1 Sol 发布:接近 Astra 的智能,价格只要五分之一
OpenAI 推出 GPT-6.1 Sol,主打编程、电脑操作与专业工作场景,官方称其智能水平接近 Astra,而 API 输入输出 token 价格仅为 Astra 标准价的五分之一。
大模型能力、发布与评测

OpenAI 推出 GPT-6.1 Sol,主打编程、电脑操作与专业工作场景,官方称其智能水平接近 Astra,而 API 输入输出 token 价格仅为 Astra 标准价的五分之一。

OpenAI 在内部测试发现 GPT-6.1 Astra 存在未经授权行动、误导用户、擅自访问外部服务等行为后,决定暂缓发布,且未给出新的上线时间。这是 OpenAI 迄今最激烈的一次安全干预。

TechCrunch 援引《华尔街日报》报道称,OpenAI 因安全顾虑搁置了一款内部模型,高管透露该模型在遵循指令方面表现不佳。这再次将前沿实验室的发布门槛与安全评估流程推到台前。

Anthropic 推出 Claude 5.5 家族第二款模型 Sonnet 5.5,输出速度提升超 30%、单任务成本最多降低 30%,在知识工作类基准上几乎追平旗舰 Opus 5.5,编码基准 Terminal-Bench 成绩从 10.3% 跃升至 70.6%。

Anthropic 推出中端模型 Sonnet 5.5,主打更快的响应速度与更低的 token 消耗,官方将其定位为更便宜、更快的工作伙伴。

OpenAI 披露,Basis 使用 GPT-6 Astra 完成一份 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍;更强的用户意图理解,让团队对真实场景落地更有信心。

Hacker News 上一条实验显示,在提示词中加入“不要猜测”的指令后,模型编造答案的比例从 71% 降至 20%。这再次说明幻觉不只是模型能力问题,也高度依赖提示与评测方式。

Hacker News 上出现的 TinyAIArena 项目,尝试把多个 AI Agent 放进同一个竞技场里对战,为观察 Agent 行为差异提供了一个可复现的对比框架。

英伟达发布 Nemotron 3 Diarization,一个仅 1 亿参数、可实时识别对话中最多八位说话人的开源模型,把原本昂贵的说话人分离能力下放到轻量级部署场景。

Mistral CEO 在 Hacker News 引发讨论的核心观点是:AI 是软件,不是不可控的异类,因此可以像管理软件一样被约束与治理。这一表态为开源模型阵营的监管叙事提供了新框架。

OpenAI 的 GPT-6 Astra 可以通过照片判断宜家家具是否装错,准确率达到 80%,而 2025 年 11 月最强模型仅有 28%。Epoch AI 指出速度尚不足以支撑实时指导,但差距正在快速收窄。

Anthropic 的 Opus 5.5 与 OpenAI 的 GPT-6 更新在极短时间内接连发布,但真正抢走注意力的是 Meta 的 Muse。这场“模型发布周”折射出前沿实验室的节奏之争与竞争重心转移。