Run Benchmark
checking TigerGraph…

Runs honest_benchmark.py --graph-native live against TigerGraph β€” real F1, LLM-judge, and BERTScore. No hardcoded or demo numbers.

10