我构建了一个由LLM驱动的模拟器,用于模拟X泄露的2026年生产排名算法,以本地对草稿进行评分
摘要
一位开发者构建了XViral,这是一个开源Python工具,利用LLM编排技术本地模拟X泄露的2026年生产排名算法,包括处理未公开的评判参数和评分草稿。
当X发布了他们最新的生产排名流水线代码和模型检查点时,网上的讨论大多沦为泛泛的营销建议。作为一名开发者,我想看看我们能否实际构建一个本地的确定性模拟环境,精确绘制出平台在文本触及服务器之前如何对其进行评分。我花了一些时间构建了一个名为XViral的开源工具,它正是为了实现这一目标。它用Python编写,利用LLM编排技术重现了发布中描述的多头评分环境。仓库地址:https://github.com/ninjahawk/XViral
最酷的工程挑战是处理算法中未公开的部分。X的发布省略了其原生Grok内容评判器的确切提示参数,但留下了严格的输入/输出模式。我使用了一个本地LLM循环来模拟这些黑盒评判器,针对这些精确的模式——特别是追踪算法如何隔离系统性信号。以下是模拟器处理的一些与常见社交媒体理论完全矛盾的有趣算法机制:
硬编码的“Slop Score”:流水线不仅查找关键词,还通过视觉-语言评判器对文本和媒体进行评分,分配一个整数slop_score(衡量重复结构模板)以及一个quality_score(“爆款”阈值)。
极端降权指标:负面反馈循环的惩罚力度远大于正面反馈。在旧的权重配置中,单个用户举报会给帖子带来−369的巨大惩罚,完全抹去了标准点赞+0.5的值。
十九个参与度预测头:排名算法并不将参与度视为单一指标。它同时运行十九个独立的预测头(分别预测回复、长时间停留、静音等概率),然后聚合出最终的“为你推荐”评分。
我已经在GitHub上以宽松许可证开源了整个模拟架构,以便人们可以检查评分公式、通过本地流水线运行自己的文本草稿,或者将LLM评判器模拟逻辑适配到其他算法平台。我很希望听到社区对使用LLM模拟开源发布中专有或未公开的评判层的看法。是否有更好的方法来校准模型权重以匹配实际的生产分布?
相似文章
从比分矩阵到足球感知的比赛状态模拟:用于精确比分重排的可审计LLM框架
本文介绍了一个用于精确比分足球预测的可审计LLM框架,该框架在四个系统迭代中整合了动态泊松族模型与基于LLM的上下文推理,并提供了2025-26赛季英格兰足球超级联赛比赛的探索性结果。
RankJudge:一个多轮LLM-as-a-Judge合成基准生成器
RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。
评估开源大语言模型在自主代号游戏模拟中的表现
一位开发者构建了一个代号游戏模拟平台,用于评估开源大语言模型在长程协作中的表现。结果显示,DeepSeek v4 Flash 在游戏逻辑对齐方面表现优异,胜出其他模型;而 Qwen 3 Next 和 GPT 5.4 Nano 则在规则约束和视角转换方面存在困难。
我构建了一个1v1核战略游戏来基准测试LLM推理(而不仅仅是选择题)——Age of LLM
名为Age of LLM的新型开源基准通过回合制核战略游戏(包含战争迷雾、外交和虚张声势)来测试LLM推理,相较于传统的多项选择基准,提供了更动态的评估。
通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差
本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。