尼日利亚机械:一个带有领域推理层的低资源工业数据集
摘要
本文介绍了尼日利亚机械使用与故障数据集,包含2006至2025年间尼日利亚制造业和油气领域的28个指标、89条记录,同时提出了一种从稀疏数值构建领域约束的链式推理示例的方法。
arXiv:2607.07883v1 公告类型:新
摘要:关于非洲经济体工业机械的公开、模型可用数据相对较少。这使得难以进行定量分析或训练语言模型处理基于该场景的数值任务。我们发布了两项成果以部分解决此问题。第一项是尼日利亚机械使用与故障数据集:包含2006至2025年间尼日利亚制造业和油气领域的28个指标、89条机器级记录。每条记录均标明了公开来源,并由编码手册解码。第二项是一种从这些稀疏数值构建链式推理(CoT)示例的方法。结果产生了94行提示、完成和推理痕迹。每行中的提示都指明了其来源记录的真正指标、子部门、年份和来源。数据适配工作由Adaption Labs完成。在此过程中,我们描述了一个在使用语言模型构建数据集时常见的问题:提示可能匹配真实数值,但完全未提及真实领域。我们证明了解决此问题可将领域约束提示的占比从先前版本的78分之1提升至94分之94,并且每个检索答案现在都与其源值匹配(84分之84)。我们以CC-BY-4.0许可发布数据、推理层以及每行来源文件。我们明确了局限性。由于只有89条记录和17个仅有单个观测值的指标,这是一个参考和种子数据集,而非大型训练集。大多数推理行是检索而非多步计算。
查看缓存全文
缓存时间: 2026/07/10 06:06
# 尼日利亚机械:含领域底层推理层的低资源工业数据集 来源:https://arxiv.org/abs/2607.07883 查看PDF(https://arxiv.org/pdf/2607.07883) > 摘要:关于非洲经济体工业机械的公开、可用于模型的数据相对较少。这使得在该领域背景下进行定量分析或训练语言模型处理数值任务变得困难。我们发布了两项成果以帮助解决部分问题。第一项是尼日利亚机械使用与故障数据集:涵盖2006年至2025年尼日利亚制造业及石油天然气领域的28个指标、89条机器级记录。每条记录都注明了公开来源,并由代码手册解码。第二项是一种从这些稀疏数值中构建思维链(CoT)推理示例的方法。最终得到了94行包含提示、补全和推理轨迹的数据。每一行中,提示都标注了该记录所对应的真实指标、子行业、年份和来源。数据适配工作由Adaption Labs完成。在此过程中,我们描述了一个在语言模型用于构建数据集时常见的问题:提示可以与真实数值匹配,却对真实领域只字不提。我们证明,修复此问题后,领域底层提示的比例从早期版本78条中的1条提升至94条中的94条,且每条检索答案都与其来源值匹配(84条中的84条)。我们在CC-BY-4.0许可下发布数据、推理层以及每条记录的可追溯源文件。我们对局限性持明确态度:仅有89条记录和17个仅有一个观测值的指标,因此这是一个参考和种子数据集,而非大型训练集。大多数推理行是检索而非多步计算。 ## 提交历史 来自:Vincent Fakiyesi [查看电子邮件](https://arxiv.org/show-email/19cdc120/2607.07883) **\[v1\]** 2026年7月8日星期三 19:38:54 UTC(269 KB)
相似文章
利用精简数据衡量贫困与不平等:一种基于尼日利亚住户数据的机器学习方法
本文应用随机森林递归特征消除(RF-RFE)对尼日利亚住户调查数据进行分析,旨在识别能够准确分类贫困状态、五分位分布和不平等位置的最小预测因子。研究表明,机器学习可以在减少数据需求的同时,保留用于监测贫困与不平等的分布信息。
为什么针对智能体工作流的真实数据集仍然难以找到?
讨论了AI智能体工作流真实数据集的稀缺性,指出现有基准测试未能捕捉到混乱的生产场景,如工具故障、模糊请求和长时间对话漂移,并寻求更好的数据集推荐。
超越目录计数:低资源多语言NLP中的数据集可见性不对称
本文介绍了资源密度指数(RDI),并利用LLM辅助的引文挖掘揭示,许多语言在目录记录中看似数据贫乏,但在研究文献中却有大量的数据集活动,凸显了低资源多语言NLP中的可见性不对称。
ConstructCIE:从建筑事故叙述中提取因果信息的数据集
本文介绍了ConstructCIE,这是一个用于从OSHA建筑事故叙述中提取因果信息的人工标注数据集,并评估了监督序列标注器和指令微调的大语言模型在端到端层次化提取中的表现。
异构设备罕见故障预测的可迁移自逻辑模型
本文提出了一种可迁移的自逻辑模型,用于跨异构传感器配置预测罕见设备故障,并在合成冰箱数据集上进行了评估。