Tag
MetroLLM-Bench is a 955-case benchmark for evaluating language models as transit kiosk policy layers, showing that small fine-tuned models can match larger models on structured tool-use and fare-quoting tasks.