Zing-27B sfida GPT-5.5 e vince nella social intelligence

Il modello della Chinese Academy of Sciences ottiene risultati superiori a GPT-5.5 nei test di social cognition

Redazione
Modello zhijing zing sociale di CAS per intelligenza artificiale empatica

Immagine copertina generata con l’intelligenza artificiale

L’intelligenza artificiale prova a colmare uno dei suoi limiti più difficili: capire il comportamento umano oltre le parole. Il 24 luglio, il CAS ICT della Chinese Academy of Sciences ha presentato ZhiJing, un sistema di social intelligence che comprende il benchmark SoMBench e il modello Zing. L’obiettivo è misurare e migliorare la capacità delle AI di interpretare contesto sociale, emozioni, intenzioni e segnali impliciti. Nei test, Zing-27B ha raggiunto il 79,80% in un punteggio composito su cinque benchmark, superando il 78,44% ottenuto da GPT-5.5.

SoMBench mette alla prova l’intelligenza sociale delle AI

Al centro del progetto c’è SoMBench, un benchmark creato per trasformare in parametri misurabili un concetto particolarmente complesso come la comprensione delle persone. Il sistema suddivide la social intelligence in tre dimensioni principali, 17 sotto-dimensioni e 71 attività specifiche, dedicate a capacità come il ragionamento sulle convinzioni, la comprensione delle emozioni, le norme sociali e la modellazione delle relazioni.

Il benchmark comprende 3.481 casi sottoposti a revisione, verificati attraverso diverse tipologie di domande: scelta singola e multipla, giudizi e quesiti a risposta aperta. Sono inoltre presenti tecniche per modificare le opzioni, individuare scorciatoie nei ragionamenti e riscrivere i casi in modo controllato, così da identificare con maggiore precisione gli errori dei modelli.

I test condotti su 20 modelli di fascia alta hanno mostrato quanto sia ancora difficile questa capacità: il modello migliore ha raggiunto appena il 72,08%, mentre nessuno ha toccato la soglia del 90%.

Zing-27B supera GPT-5.5 nei test di social cognition

È proprio in questo scenario che si inserisce Zing. Il modello Zing-27B ha ottenuto il 79,80% nel punteggio composito di cinque benchmark, superando GPT-5.5, fermo al 78,44%.

Il vantaggio emerge in particolare in alcune capacità specifiche. Nel test HiToM, dedicato al tracciamento ricorsivo delle convinzioni, Zing ha ottenuto 4,08 punti percentuali in più, mentre su EmoBench il vantaggio è arrivato a 5,62 punti percentuali.

Secondo CAS ICT, Zing-27B è inoltre il primo modello con meno di 100 miliardi di parametri a superare GPT-5.5 su HiToM. I risultati evidenziano una difficoltà che va oltre la semplice elaborazione del testo: per comprendere una situazione sociale è necessario combinare relazioni, intenzioni implicite, cambiamenti emotivi, norme e parole non pronunciate.

FLARE e il training mirato alle lacune

Per affrontare queste difficoltà, Zing utilizza una metodologia che introduce diverse innovazioni. La prima è FLARE, un sistema di generazione continua dei dati: quando durante l’addestramento emerge una determinata debolezza, il metodo produce nuovi esempi concentrati proprio su quella capacità.

L’addestramento procede poi in due fasi. La prima costruisce le competenze generali attraverso la distillazione da più insegnanti e il Mixed-Reward GRPO. La seconda applica un addestramento di rinforzo specializzato su aspetti come emozioni, intenzioni e norme sociali.

OPD evita che il modello dimentichi ciò che ha imparato

La terza innovazione riguarda l’On-Policy Distillation (OPD), progettata per affrontare uno dei rischi dell’apprendimento per rinforzo: la perdita di capacità precedentemente acquisite.

OPD introduce vincoli sulla distribuzione dei token prodotti dal modello insegnante durante le traiettorie generate online. In questo modo, Zing può esplorare percorsi di ragionamento migliori senza allontanarsi eccessivamente da quelli già considerati efficaci.

Il meccanismo viene sintetizzato da CAS ICT attraverso una distinzione precisa: GRPO spinge il modello in avanti, mentre OPD evita che si allontani troppo dai percorsi validati.

ZhiJing considera la social intelligence una capacità autonoma

L’approccio di CAS ICT parte da una premessa precisa: la capacità di comprendere le persone non deve essere considerata una semplice conseguenza della maggiore potenza di un modello.

ZhiJing tratta infatti la social cognition come una capacità ingegneristica indipendente, da valutare, addestrare e migliorare con strumenti specifici. SoMBench stabilisce cosa misurare, FLARE individua le competenze da rafforzare, il training in due fasi stabilisce come procedere e OPD contribuisce a preservare quanto già appreso.

Una nuova frontiera per i modelli di intelligenza artificiale

I risultati di Zing-27B mostrano quindi come la competizione tra modelli possa spostarsi anche sul terreno della comprensione delle dinamiche sociali. Il fatto che nessuno dei 20 modelli analizzati da SoMBench abbia raggiunto il 90% evidenzia quanto questo campo sia ancora lontano dall’essere risolto.

Con il superamento di GPT-5.5 nel punteggio composito e i risultati ottenuti nei test HiToM ed EmoBench, Zing propone un approccio specificamente costruito per affrontare emozioni, intenzioni, relazioni e segnali non esplicitati.

Fonte: Pandaily

Iscriviti alla newsletter

Non inviamo spam! Leggi la nostra Informativa sulla privacy per avere maggiori informazioni.