尼日利亚机械:一个带有领域推理层的低资源工业数据集

arXiv cs.AI 论文

摘要

本文介绍了尼日利亚机械使用与故障数据集,包含2006至2025年间尼日利亚制造业和油气领域的28个指标、89条记录,同时提出了一种从稀疏数值构建领域约束的链式推理示例的方法。

arXiv:2607.07883v1 公告类型:新 摘要:关于非洲经济体工业机械的公开、模型可用数据相对较少。这使得难以进行定量分析或训练语言模型处理基于该场景的数值任务。我们发布了两项成果以部分解决此问题。第一项是尼日利亚机械使用与故障数据集:包含2006至2025年间尼日利亚制造业和油气领域的28个指标、89条机器级记录。每条记录均标明了公开来源,并由编码手册解码。第二项是一种从这些稀疏数值构建链式推理(CoT)示例的方法。结果产生了94行提示、完成和推理痕迹。每行中的提示都指明了其来源记录的真正指标、子部门、年份和来源。数据适配工作由Adaption Labs完成。在此过程中,我们描述了一个在使用语言模型构建数据集时常见的问题:提示可能匹配真实数值,但完全未提及真实领域。我们证明了解决此问题可将领域约束提示的占比从先前版本的78分之1提升至94分之94,并且每个检索答案现在都与其源值匹配(84分之84)。我们以CC-BY-4.0许可发布数据、推理层以及每行来源文件。我们明确了局限性。由于只有89条记录和17个仅有单个观测值的指标,这是一个参考和种子数据集,而非大型训练集。大多数推理行是检索而非多步计算。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:06

# 尼日利亚机械:含领域底层推理层的低资源工业数据集
来源:https://arxiv.org/abs/2607.07883
查看PDF(https://arxiv.org/pdf/2607.07883)

> 摘要:关于非洲经济体工业机械的公开、可用于模型的数据相对较少。这使得在该领域背景下进行定量分析或训练语言模型处理数值任务变得困难。我们发布了两项成果以帮助解决部分问题。第一项是尼日利亚机械使用与故障数据集:涵盖2006年至2025年尼日利亚制造业及石油天然气领域的28个指标、89条机器级记录。每条记录都注明了公开来源,并由代码手册解码。第二项是一种从这些稀疏数值中构建思维链(CoT)推理示例的方法。最终得到了94行包含提示、补全和推理轨迹的数据。每一行中,提示都标注了该记录所对应的真实指标、子行业、年份和来源。数据适配工作由Adaption Labs完成。在此过程中,我们描述了一个在语言模型用于构建数据集时常见的问题:提示可以与真实数值匹配,却对真实领域只字不提。我们证明,修复此问题后,领域底层提示的比例从早期版本78条中的1条提升至94条中的94条,且每条检索答案都与其来源值匹配(84条中的84条)。我们在CC-BY-4.0许可下发布数据、推理层以及每条记录的可追溯源文件。我们对局限性持明确态度:仅有89条记录和17个仅有一个观测值的指标,因此这是一个参考和种子数据集,而非大型训练集。大多数推理行是检索而非多步计算。

## 提交历史

来自:Vincent Fakiyesi [查看电子邮件](https://arxiv.org/show-email/19cdc120/2607.07883) **\[v1\]** 2026年7月8日星期三 19:38:54 UTC(269 KB)

相似文章