parameters

标签

Cards List
#parameters

Deepseek v4.1 flash 终于有了 engrams,你对 4.1 pro 有什么期待?

Reddit r/LocalLLaMA · 2026-09-10

关于 Deepseek v4.1 pro 规格和未来发展的推测,包括参数数量和 engram 技术。

0 人收藏 0 人点赞
#parameters

@ShreyashJokare: 2000亿参数

X AI KOLs Timeline · 2026-08-29 缓存

推文突出展示了一个拥有2000亿参数的AI模型,表明了机器学习开发的重大规模。

0 人收藏 0 人点赞
#parameters

@rohanpaul_ai: Zhipu创始人Tang Jie的精彩文章。AI扩展正在超越参数增长。“有多少参数?”正变得……

X AI KOLs Following · 2026-08-20 缓存

Zhipu创始人Tang Jie讨论了AI扩展如何超越参数数量,涵盖训练数据、每次前向传播的计算量以及后训练等因素,并以GLM-5.3为例。

0 人收藏 0 人点赞
#parameters

最具吸引力的象限已被占用!这正在发生!

Reddit r/singularity · 2026-08-17

Artificial Analysis 的一项分析表明,AI 模型最具吸引力的象限已被占用,这标志着开源模型的重要进步。

0 人收藏 0 人点赞
#parameters

奇怪的是,没人讨论 Qwen3.8 27b 的温度设置

Reddit r/LocalLLaMA · 2026-08-17

帖子讨论了 Qwen3.8 27b 的默认温度设置为 1.0,并建议将其设置为 0.7 以减少不必要的推理,同时质疑这对模型能力的影响,以及各种任务的最佳设置。

0 人收藏 0 人点赞
#parameters

@Dinosaur_liu: 给全部中美模型厂商说个鬼故事 DeepSeek V4 Flash 只有284b参数 激活参数只有区区13b

X AI KOLs Timeline · 2026-08-03 缓存

据称 DeepSeek V4 Flash 仅有2840亿参数,激活参数仅130亿,对中美模型厂商构成效率冲击。

0 人收藏 0 人点赞
#parameters

Deepseek,请解释一下你们是如何让一个300B参数的模型比9B参数的模型便宜那么多的?

Reddit r/singularity · 2026-07-31

一位Reddit用户询问DeepSeek如何让一个300B参数的模型比9B参数的模型更便宜,引发了关于效率和成本的讨论。

0 人收藏 0 人点赞
#parameters

Gemini 最新模型:temperature、top_p 和 top_k 参数已被弃用并忽略

Hacker News Top · 2026-07-21

Google 的 Gemini 模型正在弃用并忽略 temperature、top_p 和 top_k 参数,这可能是为了简化推理配置。

0 人收藏 0 人点赞
#parameters

未调优的27B模型在智能体任务中击败了调优的75B模型

Reddit r/LocalLLaMA · 2026-07-10

一项比较显示,未调优的27B参数模型在智能体任务中优于调优的75B参数模型,凸显了扩展和微调可能存在的低效问题。

0 人收藏 0 人点赞
#parameters

@witcheer:Gemma 4 发布了一个12B版本。我将其放在RTX 5090上与31B的兄弟型号进行对比。当你把一个模型从31B裁剪到12B时,你到底失去了什么……

X AI KOLs Timeline · 2026-06-03 缓存

对Gemma 4 12B和31B模型的对比显示,较小的模型几乎完整保留了推理能力,但知识储备大幅下降,使其成为推理任务的理想选择,而较大的模型则更适合广泛知识的问答。

0 人收藏 0 人点赞
#parameters

@NeoAIForecast: https://x.com/NeoAIForecast/status/2058479806048792583

X AI KOLs Timeline · 2026-05-24 缓存

关于本地LLM的完整教育系列,涵盖推理、tokens、权重以及系统级理解,适合初学者和参考。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈