标签
关于 Deepseek v4.1 pro 规格和未来发展的推测,包括参数数量和 engram 技术。
Zhipu创始人Tang Jie讨论了AI扩展如何超越参数数量,涵盖训练数据、每次前向传播的计算量以及后训练等因素,并以GLM-5.3为例。
Artificial Analysis 的一项分析表明,AI 模型最具吸引力的象限已被占用,这标志着开源模型的重要进步。
帖子讨论了 Qwen3.8 27b 的默认温度设置为 1.0,并建议将其设置为 0.7 以减少不必要的推理,同时质疑这对模型能力的影响,以及各种任务的最佳设置。
据称 DeepSeek V4 Flash 仅有2840亿参数,激活参数仅130亿,对中美模型厂商构成效率冲击。
一位Reddit用户询问DeepSeek如何让一个300B参数的模型比9B参数的模型更便宜,引发了关于效率和成本的讨论。
Google 的 Gemini 模型正在弃用并忽略 temperature、top_p 和 top_k 参数,这可能是为了简化推理配置。
一项比较显示,未调优的27B参数模型在智能体任务中优于调优的75B参数模型,凸显了扩展和微调可能存在的低效问题。
对Gemma 4 12B和31B模型的对比显示,较小的模型几乎完整保留了推理能力,但知识储备大幅下降,使其成为推理任务的理想选择,而较大的模型则更适合广泛知识的问答。
关于本地LLM的完整教育系列,涵盖推理、tokens、权重以及系统级理解,适合初学者和参考。