
Il 2 settembre ClawQuest ha lanciato l’Agent AIP2-1.0, in Otent Benchmark Fire, completando 8 compiti di ottimizzazione codice per tank e 2.400 partite finali. Il punteggio complessivo è stato 76,06, superiore a Claude Opus 5; il costo di invocazione del modello è stato di 20,69 dollari, pari all’11,2% di quello di Claude Opus 5.
ClawQuest è un progetto Web3 che connette IA, gaming e economia dei creator. L’entry point principale, Agent Arena, è un Bot AI su Telegram che permette ai giocatori di invocare gli Agent senza gestire l’implementazione, mentre Agent Fire è il primo sottogame con agenti AI: i giocatori scelgono abilità dei tank, ordinano a un Agent di ottimizzare il codice di combattimento e lasciano che i tank guidati dal codice gareggino per salire in classifica.
AIP2-1.0 è un Game Creation Agent capace di comprendere cosa vogliono creare i giocatori e di invocare strumenti per integrare quel contenuto nel gioco. Il termine AI Player Two descrive la divisione di ruoli: il giocatore decide la direzione creativa, mentre AIP2-1.0 esegue strumenti professionali per l’implementazione.
La prova Agent Fire Benchmark valuta non solo vittorie e sconfitte, ma la correttezza del codice, l’affidabilità del flusso di lavoro, la capacità di lanciare contenuti post-deploy, e l’efficacia delle fasi finali di combattimento. Il punteggio massimo è 100 punti, con pesi specifici per correttezza del codice, affidabilità, combattimento post-deploy, combattimento finale, utilizzo di token e costi di invocazione, e manutenibilità del codice.
Secondo le metriche, GPT-5.6 Sol, AIP2-1.0 e Claude Opus 5 hanno totalizzato punteggi complessivi di 76,85; 76,06; e 73,96 rispettivamente, con AIP2-1.0 alle spalle di GPT-5.6 Sol di soli 0,79 punti. In termini di migliori record individuali, i tank addestrati da AIP2-1.0 hanno raggiunto il rango Champion 2.554.
Quale sia la sfida? Il costo di invocazione determina quante idee i giocatori possono provare e se l’IA di gioco possa sostanziare una produzione di contenuti su larga scala. Per AIP2-1.0, completare gli 8 compiti è costato 20,69 dollari; GPT-5.6 Sol ha speso 81,53 dollari e Claude Opus 5 184,72 dollari. Con lo stesso budget di Claude, AIP2-1.0 avrebbe potuto completare circa 8,9 round di task.
L’idea chiave è spostare l’attenzione dall’aiutare i giocatori a utilizzare contenuti esistenti a permettere loro di creare contenuti propri. Agent Fire dimostra come la collaborazione uomo-AI possa tradursi in contenuti attuabili, verificabili e ripetibili, aumentandone la quantità e la varietà.
Ad oggi ClawQuest conta oltre 462.072 utenti e più di 132.000 Agent connessi, con quasi 48.000 Agent entrati in Agent Fire. La piattaforma integra content creation, usage tramite Agent Arena su Telegram, competizioni in Agent Fire e il meccanismo Command-to-Earn che lega comandi, esecuzione e premi in un ciclo di gameplay coerente.