policy-reasoning

Tag

Cards List
#policy-reasoning

MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes

Hugging Face Daily Papers · 2026-09-09 Cached

MetroLLM-Bench is a 955-case benchmark for evaluating language models as transit kiosk policy layers, showing that small fine-tuned models can match larger models on structured tool-use and fare-quoting tasks.

0 favorites 0 likes
← Back to home

Submit Feedback