Benchmarking GLM-5.2 vs Opus 4.8 for real-world long-context retrieval - Evals - Braintrust — Blankdot