[ACL 2025] GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
benchmarkopenaievaluation-frameworklarge-language-modelschatgptllm-evalqwendeepseekknowledge-evaluationreliable-evaluationgamearenaguessarenadomain-specific-evalreasoning-evaluation
-
Updated
Nov 15, 2025 - Python