标签
新版 Gemini 3.5 Flash 已在 Antigravity 上推出,针对更困难的任务进行了改进,并为所有用户重置了速率限制。
深度分析Anthropic的Claude Opus 4.8系统卡,详细阐述了相较Opus 4.7在能力、安全评估和对齐风险方面的增量改进。
Anthropic的Claude Opus 4.8更新大幅减少了自信但错误的答案,在报告有缺陷的结果上得分为0%,并提供了一个提示词来利用这一改进进行关键的自我批判。
Opus 4.8 现已可在 DeepSWE 上使用,得分比 Opus 4.7 高出6%,并降低了每任务平均成本。
OpenAI 发布了新版 GPT-5.5 Instant,在讨好性、事实准确性和多语言性能方面有所改进,并正在寻求用户反馈。
Claude Opus 4.8已上线,编程和agent能力增强,支持数百并行子agent的动态工作流,价格不变。Anthropic还预告数周内将发布Mythos级别模型。
llm-anthropic 0.25.1 新增对 Claude Opus 4.8 的支持、快速模式选项,并更新了默认的 max_tokens 行为。
询问 Opus 4.7 和 Opus 4.8 之间的权重变化百分比。
本讨论探讨了基于历史深度伪造样本训练的活体检测模型是否能泛化到新的合成媒体生成技术,质疑声称具备深度伪造检测能力的供应商的更新周期。
随着实时语音交互能力的提升,Horace AI 模型现已更易于使用。thinkymachines 对此更新进行了重点介绍。
OpenAI announces an update focused on making model responses more concise, based on user feedback.
早期用户反馈:Qwen 3.6 27B 相比 3.5 性能暴涨,在前端设计与智能体基准上表现尤为亮眼。
Anthropic 发布了 Claude Opus 4.7,系统提示有显著变化,包括扩展的儿童安全指令、新的工具集成(Claude 在 PowerPoint、Chrome、Excel 中),以及行为调整以减少冗长并提高任务完成度,避免不必要的说明。
OpenAI发布了GPT-5.3 Instant,这是ChatGPT最常用模型的更新。它改善了对话流畅度,减少了不必要的拒绝,并在高风险领域将幻觉率降低了高达26.8%。该更新基于用户反馈,专注于语气、相关性和实际可用性。
OpenAI 发布 GPT-5 系列最新模型 GPT-5.2,并更新系统卡片以记录安全缓解措施,同时推出 GPT-5.2 Instant 和 GPT-5.2 Thinking 变体。
OpenAI 在 10 月 3 日发布了 GPT-5 的更新,通过与 170 多名心理健康专家的合作,改进了对心理和情感困扰相关敏感对话的处理,将不充分的回应减少了 65-80%。公司发布了系统卡补充文档和安全评估,对比了新模型与 8 月 15 日的前一版本。
Google DeepMind的Gemini Robotics 2将物理AI扩展到全身控制,使类人机器人能够在杂乱空间中执行需要伸展、弯腰和平衡的任务。
OpenAI与Databricks合作推出GPT-5.5模型,在agent框架中错误率降低46%,成为唯一在基准测试中超过50%的模型,解析质量和函数调用能力显著提升。