Ілон Маск повідомив, що мовна модель Grok 4.5 посіла перше місце в рейтингу Long-Horizon Terminal-Bench за підсумками липня 2026 року.
Long-Horizon Terminal-Bench (LHTB) — це спеціалізований бенчмарк для ШІ-агентів, призначений для тестування їхньої здатності вирішувати складні завдання, що вимагають багатоетапного планування, аналізу та послідовного прийняття рішень у середовищі командного рядка.

Grok 4.5 показав середній результат 0,505 і успішно впорався з 13 із 46 тестових завдань. Особливо помітний прогрес порівняно з попередньою версією Grok 4.20, яка не змогла вирішити жодного завдання в цьому бенчмарку.
При цьому Grok 4.5 випередив Claude Sonnet 5, Opus 4.8, Fable 5, GPT-5.5 та інші моделі.