标签
本文引入了一种六维提示侧结构复杂度指数,用于在大语言模型中独立于功能正确性衡量代码生成可靠性,通过评估21个模型在5000个Python提示上的表现,以识别非单调可靠性区间。
本文分析了 Claude Code 部署中的 token 成本构成,揭示只有 14% 的输入 token 是用户提示,其余为配置和上下文,并提供了降低账单 20-40% 的见解。
本文分析了用户向大语言模型提出的关于数字安全与隐私的真实问题,将其分为九个主题,并评估了商业模型和开放权重模型在回答质量和一致性上的表现。