标签
一个名为claude-code-local的新开源工具允许在MacBook上本地运行一个122B参数的模型,每秒处理65个token,并完整支持Claude Code,在原始速度上击败云端Opus。
一项基准测试显示,Diffusion Gemma 比 Gemma4 速度快4倍,但事实性错误多6倍,尤其是在冷门话题上,为了生成流畅文本而牺牲了事实准确性。
Steeve Morin 报告称,经过5天的工作,他的实现速度现已与llama.cpp相差不到10%,达到每秒64个token对70个token,还需继续优化。
一个Twitter讨论串,探讨了数据库文件系统抽象(PostgresFS)和基于技能的方法(使用本地 Bash)哪个更适合代理工作流。技能方法在组合性和速度上胜出。
根据早期结果,Mixedbread 的重排序器在 OBLIQ-bench 上达到了 GPT 5.5 级别性能,同时速度快 27 倍。
Jerry Liu宣布了LiteParse v2,一款基于Rust的PDF解析器,据称是目前最快、最准确的开源、无模型PDF解析器。
介绍LFM2.5 8b A1b,一款性能与Nemotron 3 Nano相当但速度更快的新AI模型。SmallCode正在增加对非标准工具调用的支持。
谷歌发布了 Gemini 3.5 Flash,这是一款混合速度模型,在速度和成本上与 Opus 4.7 和 GPT-5.5 相抗衡,同时在智能体和编程基准测试中表现良好。
推广 Atlas Inference,这是一个开源推理服务工具,在 Qwen3.6-35B-A3B 基准测试上实现了 200+ tok/s 的性能。
Mozilla宣布Project Nova,这是Firefox的重新设计,专注于隐私、速度以及更简洁、更温暖的设计,并对标签、设置和紧凑模式进行了更新。
用户分享了一种在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案,实现了每秒超过 40 个 token 的速度。他们邀请其他人尝试并进一步优化。
Cerebras is now running Kimi K2.6, a trillion-parameter model, in enterprise trials at ~1,000 tokens/s, the fastest frontier model performance ever measured by Artificial Analysis.
一条推文强调谷歌的 Gemini 3.5 Flash 是一款快速、强大且价格实惠的 AI 模型发布,重点突出了其令人印象深刻的基准测试和性价比。
Julien C 解释了如何运行带有MTP(多令牌预测)的llama.cpp,以实现约2倍的生成速度,可以使用Dense 27B或MoE 35B模型,并提供了安装和配置说明。
Unsloth Qwen3.6 27B Q6_K 在 RTX 5090 上通过 MTP 达到每秒超过 100 个令牌,相比没有 MTP 时的 45-50 令牌/秒显著提升。
UnslothAI创始人Daniel Han发布了Qwen3.6的实验性MTP GGUF版本,在消费级GPU上实现27B模型140 tokens/s、35B-A3B版本220 tokens/s,速度提升1.4倍且精度零损失。
TanStack Devtools 迁移到了 OxcProject 解析器和 magic-string,实现了 3.56 倍的加速,单文件转换时间从 1.65 毫秒降至 0.46 毫秒。
OpenAI 预览了 GPT-5.6 Sol 的 Ultrafast 模式,速度最高提升 14 倍,同时保持与标准模式同等质量的智能,可在监控、数据处理、搜索和编码等场景中实现近乎实时的体验。