Addio ai modelli frammentati: SenseTime lancia SenseNova-Vision

Il modello open-source di SenseTime raggiunge la vetta della classifica Any-to-Any e introduce un nuovo approccio alla visione artificiale

Redazione
Sense nova vision interfaccia grafica modello visual AI unificato open-source

L’azienda cinese SenseTime ha annunciato il rilascio in modalità open-source di SenseNova-Vision, un nuovo modello di intelligenza artificiale pensato per riunire in un’unica architettura alcune delle principali attività della computer vision. La piattaforma è in grado di gestire rilevamento degli oggetti, segmentazione delle immagini, stima della profondità e ricostruzione 3D, eliminando la necessità di utilizzare modelli distinti per ogni singolo compito. Contestualmente, il modello ha raggiunto il primo posto nella classifica Hugging Face Any-to-Any, diventando il primo sistema sviluppato da un’azienda cinese specializzata nella visual AI a conquistare la vetta di questo benchmark multimodale.

Un nuovo paradigma per la visual AI

Con SenseNova-Vision, SenseTime propone un approccio differente rispetto ai tradizionali sistemi di computer vision. Finora, attività come il riconoscimento degli oggetti, la segmentazione delle immagini, la previsione della profondità o la ricostruzione tridimensionale richiedevano modelli specializzati, ciascuno dotato di proprie architetture, funzioni di perdita e regole di decodifica.

Il nuovo modello supera questa frammentazione trasformando tutte queste operazioni in problemi di generazione multimodale all’interno di un’unica struttura generativa. In questo modo non sono più necessari componenti dedicati a ogni attività, semplificando lo sviluppo e la distribuzione delle applicazioni di visione artificiale.

Secondo SenseTime, questa impostazione permette anche di rendere il modello più flessibile. Gli sviluppatori possono infatti descrivere nuovi compiti attraverso il linguaggio naturale, senza che tali attività siano state necessariamente incluse durante la fase di addestramento. Questo dimostra come la comprensione dello spazio e delle immagini sia diventata una capacità nativa del modello e non semplicemente una funzione programmata.

Prestazioni ai vertici e primo posto su Hugging Face

Uno dei risultati più significativi ottenuti da SenseNova-Vision riguarda il suo posizionamento nella Hugging Face Any-to-Any Leaderboard, dove occupa il primo posto a livello mondiale.

I test pubblicati mostrano come il modello riesca a eguagliare o superare le prestazioni di sistemi specializzati nelle quattro attività principali: rilevamento degli oggetti, segmentazione, stima della profondità e ricostruzione 3D.

SenseTime evidenzia inoltre le capacità di generalizzazione zero-shot, ossia la possibilità di affrontare compiti mai visti durante l’addestramento senza ulteriori ottimizzazioni. Nei test effettuati, il modello è stato in grado di eseguire contemporaneamente predizione delle normali delle superfici, segmentazione delle istanze e rilevamento degli oggetti anche in immagini tratte da videogiochi come Minecraft.

Le prove mostrano inoltre risultati convincenti in scenari particolarmente complessi, caratterizzati da oggetti sovrapposti, riflessi negli specchi e illusioni di profondità, contesti nei quali il modello ha mantenuto prestazioni superiori rispetto a numerose soluzioni tradizionali dedicate a singoli compiti.

Un rilascio open-source completo

L’apertura del progetto rappresenta uno degli aspetti più rilevanti dell’annuncio. SenseTime non ha infatti distribuito soltanto il modello finale, ma anche il codice sorgente, la procedura di addestramento e un corpus di alta qualità composto da 50 milioni di campioni.

L’azienda ha inoltre pubblicato script e regole di conversione che consentono alla comunità di riprodurre il processo utilizzando dataset pubblici. Si tratta di una scelta ancora poco comune nel settore della visual AI, dove molti modelli rimangono completamente chiusi oppure vengono resi disponibili solo in modo parziale.

Questa strategia punta a favorire la collaborazione tra ricercatori, aziende e sviluppatori, accelerando la realizzazione di nuove applicazioni basate sulla computer vision.

Una piattaforma unica per molteplici applicazioni

Il rilascio di SenseNova-Vision si inserisce nella strategia con cui SenseTime intende superare quella che definisce l’era degli “stitch-monster”, ovvero sistemi costruiti assemblando numerosi modelli indipendenti, difficili da mantenere e da integrare.

L’obiettivo è sostituire queste architetture con un unico modello capace di soddisfare la maggior parte delle esigenze più frequenti nel campo della visione artificiale. Secondo l’azienda, questo approccio potrà trovare impiego in diversi settori, tra cui ispezione industriale, guida autonoma e smart retail.

La scelta arriva inoltre in un momento in cui SenseTime sottolinea di essere stata leader nel mercato cinese della visual AI per dieci anni consecutivi e di aver raggiunto la leadership globale nell’analisi video nel 2025. Con SenseNova-Vision, la società punta quindi a trasformare un singolo modello in una piattaforma riutilizzabile per un’ampia gamma di applicazioni basate sull’intelligenza artificiale visiva.

Fonte: Pandaily

Iscriviti alla newsletter

Non inviamo spam! Leggi la nostra Informativa sulla privacy per avere maggiori informazioni.