I test di matematica sono stati il metodo di riferimento per valutare le capacità dei modelli di intelligenza artificiale come ChatGPT e Claude. OpenAI afferma che i suoi modelli ora ottengono risultati così buoni che i test matematici esistenti stanno diventando meno utili. Così i ricercatori hanno provato qualcosa di più difficile.
Hanno sottoposto a un modello non ancora pubblicato circa 4.000 problemi matematici irrisolti. I risultati sono stati sorprendenti e preoccupanti.
L’intelligenza artificiale ha prodotto 722 manoscritti, raggruppati in 372 famiglie di risultati correlati. OpenAI afferma che ogni risultato ha richiesto in media circa tre ore di elaborazione logica.
“Sono in arrivo giorni davvero entusiasmanti per la comunità matematica!” ha dichiarato Stefano Gogioso, membro del Future Tech and AI Experts Council di BeInCrypto
L’intelligenza artificiale sta diventando troppo potente troppo velocemente?
Questa è la questione più ampia. La frontier AI sta iniziando a spingersi oltre il rispondere a domande note, generando anche possibili risposte a quesiti sconosciuti.
Questo potrebbe aumentare drasticamente la quantità di lavoro intellettuale che un ricercatore, ingegnere o analista può tentare di svolgere.
Ma l’output non è verità. Molti degli articoli pubblicati da OpenAI sono corredati da dimostrazioni formali verificabili al computer con Lean. Altri no. OpenAI mette in guardia sul fatto che alcuni risultati non verificati “potrebbero avere dei problemi.”
Questo crea un nuovo collo di bottiglia: gli esseri umani potrebbero avere difficoltà a verificare le ricerche tanto velocemente quanto l’intelligenza artificiale riesce a produrle.
L’intelligenza artificiale può ora effettuare analisi predittive e prendere decisioni di investimento?
Potenzialmente sì, ma la finanza è difficile in modo diverso.
Una dimostrazione matematica può essere dimostrata prima o poi giusta o sbagliata. I mercati sono rumorosi e in continua evoluzione.
I recenti benchmark della finanza mostrano ancora che la frontier AI fatica con le ricerche sugli investimenti più complesse, mentre gli studi sul market timing riscontrano ancora un vantaggio predittivo limitato.
Nel breve termine, l’opportunità è rappresentata da analisi più approfondite piuttosto che da previsioni perfette.
Un’intelligenza artificiale capace di ragionare in modo prolungato per ore potrebbe esaminare contemporaneamente documenti, conference call sui risultati, dati macroeconomici e scenari alternativi, verificando molte più ipotesi di quanto potrebbe fare un singolo analista.
Potrebbe essere questo il vero segnale dall’esperimento di OpenAI: l’intelligenza artificiale sta diventando in grado di produrre lavoro analitico serio in volumi straordinari. Il prossimo problema sarà stabilire quali di questi risultati meritano davvero fiducia.









