Privacy-first local AI model comparison platform with blind evaluation, per-model hyperparameters, and multi-configuration testing. Compare 2-6 models side-by-side through Ollama with zero cloud dependencies.
-
Updated
Jul 3, 2026 - TypeScript
Privacy-first local AI model comparison platform with blind evaluation, per-model hyperparameters, and multi-configuration testing. Compare 2-6 models side-by-side through Ollama with zero cloud dependencies.
Which LLM do you actually trust? Blind-test 100+ AI models with truth scoring and reasoning failure classification. No branding, no marketing — just data.
Presient Skills Evals — Scientific evaluation reports for AI skill optimization
Claude skill for testing documentation completeness using blind sub-agents
Diagnose reasoning errors in large language models using blind human voting and detailed failure analysis without revealing model identities.
Add a description, image, and links to the blind-testing topic page so that developers can more easily learn about it.
To associate your repository with the blind-testing topic, visit your repo's landing page and select "manage topics."