标签
本文首次系统研究了不同模型和硬件的本地AI推理效率,测量了每瓦智能,并显示从2023年到2025年效率提升了5.3倍,表明有可能重新分配对集中式基础设施的需求。
本文追踪各种低比特AI模型的更新,包括Bonsai、BitCPM等,涵盖性能改进及对llama.cpp等后端的兼容性更新。
本文复现了一项关于使用FLOPs评估AI效率的研究,验证了原始FLOPs在新硬件上不适合作为执行时间的度量,并强调了研究中完整复现包的必要性。
这篇文章质疑在资源有限的系统上运行的 Qwen 3.5 9B 是否能超越 GPT-4o,突出了其小于 7 GB 的小巧尺寸和声称的优越性能。
Elon Musk 强调 Intelligence/Joule 的持续改进,Amjad Masad 报告称,在16个月内,每焦耳智能提升了18倍。
Elon Musk 认可 Grok 是最高效的高智能 AI 这一说法,并引用了 Grok 4.6 的每美元智能表现。
项目PUA AI收集了14种中国大厂内部话术,按任务自动切换以指导AI行为,实验表明能提升修复点36%、验证步骤65%、工具调用和隐藏问题发现50%。
一项分析对比了大语言模型推理中的预填充与解码阶段,探讨在本地大语言模型部署中,预填充在投资回报率方面是否未被充分重视。
一个假设场景展示了AI提升公司效率如何导致裁员,但也催生了新的竞争,从而重新雇佣员工,最终使经济受益。
作者认为,尽管当前AI的扩展方法是工程的巅峰,但其效率极其低下,未来会被视为原始,就像我们现在看待1960年代的大型主机一样。
据报道,OpenAI开发了一种将AI推理成本减半的方法,这可能对部署大型语言模型的经济性产生重大影响。
OpenRouter 推出 Fusion API,这是一种复合模型,通过结合多个AI模型,以一半的价格实现神话般的智能,可能改变AI性能的前沿。
文章分析了AI工具导致自由职业者时薪下降60%的“时薪陷阱”,并提出转向价值定价和整合AI工作流的解决方案;同时提到Upwork 2026年春季更新将AI Agent全面嵌入工作流。
本文报道了Fiverr向AI驱动市场的战略转型,推出智能匹配引擎Fiverr Neo,并分析了AI工具对自由职业者收入模式的影响,指出按小时计费导致收入下降60%,建议转向价值定价。
Garry Tan 和 Diana Hu 在斯坦福 CS153 课上分享了 YC 的 SAFE 协议如何标准化种子轮融资,以及 AI 时代小团队通过“软件工厂”理念和工具 Gstack 实现指数级增长的实践经验。
萨提亚·纳德拉将AI时代的新公式定义为“每美元每瓦特的Token数”,并强调基础设施的重要性。
一场关于AI模型长期可持续性的讨论,质疑由于高昂的计算成本和对投资者资金的依赖,探讨资源效率的提升能否防止泡沫破裂。
本文分析了在 MacBook Pro 上本地运行 AI 推理的可行性,对比了本地 Qwen 35B 模型与云端 Claude Opus 4.5。结论是,对于常规任务,本地模型速度快 2 倍,尽管在能力上略有差距,但仍是日常工作量中一半任务的实用选择。
Paradigm 利用 GPT-4 的自然语言理解能力,显著改进了临床试验的患者筛选流程。相比传统人工审核每天约50名患者,该方案能够每分钟评估数百名患者,大幅减轻临床医生的工作负担,并改进患者获取治疗方案的机会。