Tag
This paper introduces Harness-Zero, a method for distilling optimized agent harnesses into large language models via agent-as-harness, significantly boosting task performance in knowledge work, tool use, and science domains even after specialized harnesses are removed.
CriticGen is a fine-grained, generation-aware evaluation framework for large language models that generates sample-specific evaluation criteria to provide actionable feedback for improving answer quality.