标签
Thinking Machines 的 Inkling 模型在美国开放权重模型中排名第一。
InvincibleHunter 声称 GPT-5.6 Sol 是有史以来最令人印象深刻的模型,在数学和视觉能力上有巨大改进,超越了其他模型。
掌控Agent学习循环并租赁模型;私有评估、追踪和记忆会随时间累积。
分享Codex最节省用量的配置:模型使用5.6 Sol,Effort选择Extra High或Max,Speed选择Standard。Ultra Speed效果差,Fast太耗token。
Alexandr Wang 表示,Muse Spark 1.1 是一款具备行业竞争力的 Agentic 和编程模型,在多个评测中可与 GPT-5.5 和 Opus 4.8 抗衡,现可通过 Meta Model API 和 Meta AI 使用。
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。
本文介绍了Goku,一个百万规模的指令驱动视频编辑数据集与基准,支持多任务和结构性操作。配套的模型Goku-Edit在指令遵循方面比开源模型提升了高达8%。
DataClaw0提出了一种智能数据裁剪范式,利用可学习的数据处理来结构化高熵多模态流,通过在一个新型基准上进行SFT和GRPO实现了稳健的对齐。
文章质疑了Alpie Core 32B(一个针对低显存和智能体工作流优化的4位推理编码模型)的供应商基准测试的有效性,指出缺乏独立的基准测试复现。
Maxime Labonne分享说,他们的模型在Hugging Face上成为热门,并且尽管只有1B个活跃参数,但在代理任务上出人意料地强大。
该推文对 Qwen3.6-27B 的思考模式与非思考模式进行了 300+ 问题的基准测试,揭示了这款热门本地模型及其在 Hugging Face 上的衍生生态系统的惊人结果。
一位OpenAI研究员声称,其模型对离散几何中一个Erdős问题的解决是迄今为止AI领域最大的成就,但预测到年底时这一成就将被超越。
GPT-5.5-Cyber 现已面向防御者提供有限预览,提供用于保护关键基础设施的强大模型。