Scheda tecnica · piattaforma NVIDIA · rev. 1.0

Tutto il sistema.
In una scatola da un litro.

Hardware, modelli e budget di memoria di Nova. Ogni componente della catena — ragionamento, lettura documenti, ricerca semantica, generazione — viene eseguito sulla macchina. Nessun account, nessuna chiave API, nessun dato in uscita.

NVIDIA GB10 GRACE BLACKWELL · 128 GB UNIFIED · 0 BYTE IN USCITA
128 GBMemoria unificata coerente
CPU e GPU, stesso indirizzo
1 PFLOPFP4 con sparsità
GPU Blackwell
1,13 litri240 W
una scatola da un litro, alla lettera
0 byteTrasmessi a terzi
durante l'inferenza

01Piattaforma hardware

Una scatola da 1,13 litri. Nessun rack, nessuna sala server, nessun sistemista.

Sotto inferenza continua la ventola è udibile, come in un portatile che sta lavorando davvero. Non richiede però né un locale tecnico né raffreddamento dedicato.

ComponenteSpecifica
SuperchipNVIDIA GB10 Grace Blackwell — piattaforma DGX Spark (ASUS Ascent GX10)
CPU20 core Arm — 10× Cortex-X925 + 10× Cortex-A725
GPUBlackwell con Tensor Core di 5ª generazione — 1 PFLOP in FP4 (con sparsità)
Memoria128 GB LPDDR5X unificata e coerente — CPU e GPU condividono lo stesso spazio di indirizzamento
Banda di memoria273 GB/s — è il fattore che determina la velocità di generazione
StorageNVMe PCIe Gen4 — 1 TB (Desktop) · 4 TB (Server)
ReteWi-Fi 7, Bluetooth 5.4, NVIDIA ConnectX integrato
Sistema operativoDGX OS (Ubuntu, ARM64). Nessun parametro kernel da configurare: i 128 GB sono nativamente accessibili alla GPU
Formato e consumo1,13 litri · 240 W
EspandibilitàDue unità si collegano via ConnectX per reggere modelli più grandi
Perché la memoria unificata coerente è il punto

Su una scheda video la memoria è un limite invalicabile: una GPU da 24 GB non può caricare un modello da 60 GB, punto. Qui CPU e GPU non condividono soltanto la capacità — condividono lo stesso spazio di indirizzamento. Nessuna copia, nessun travaso tra due memorie separate: il modello sta dove serve, e ci resta.

Il vantaggio che non si vede nei benchmark

La lettura dei documenti, non la scrittura delle risposte.

La velocità con cui Nova scrive è limitata dalla banda di memoria (273 GB/s): siamo sui ~55–60 token al secondo, in linea con qualunque altra macchina da 128 GB. Ma la velocità con cui Nova legge — ingerire un contratto di ottanta pagine prima di ragionarci — è un compito di calcolo, e lì la GPU Blackwell con 1 PFLOP in FP4 opera su un altro ordine di grandezza rispetto a una grafica integrata.

È esattamente il carico di lavoro di Nova: assorbire documenti aziendali, poi ragionarci sopra. Il tempo che l'utente aspetta prima di vedere la prima parola della risposta è quello che si accorcia — ed è il tempo che percepisce come lentezza.

Due configurazioni: Desktop e Server

Lo stesso hardware in due configurazioni. Cambia come le intelligenze vengono allocate — dedicate a un singolo utente per la massima precisione, o ottimizzate per servire un intero team.

DesktopServer
UtentiUn utente alla voltaPiù utenti in contemporanea
IntelligenzeUn modello specializzato per ogni agenteModelli ottimizzati per servire tutti gli agenti
Risorse per agenteDedicateCondivise fra gli agenti
PrecisioneEstrema — ogni agente lavora al massimoOttimizzata per il carico condiviso
Storage1 TB NVMe4 TB NVMe
Per chiIl singolo professionistaTeam e reparti con più utenti

02Le intelligenze di Nova

Quattro intelligenze specializzate, ognuna per un compito. Tutte a pesi aperti, tutte in locale, tutte caricate in memoria durante il lavoro.

Cervello sempre caldo

Tipo di intelligenza: MoE — molti parametri complessivi, pochi attivi per ogni parola generata

Il motore di ragionamento di Nova. Interpreta la richiesta, decide quali dati leggere e quali strumenti usare, incrocia le informazioni dei gestionali e produce il risultato finale — un report, un'email, un documento pronto. L'architettura MoE attiva solo una frazione dei suoi parametri a ogni passo: è ciò che la rende veloce pur restando capace sui compiti complessi. Resta sempre in memoria, così tra una richiesta e l'altra non c'è attesa di caricamento.

Occhi sempre caldo

Tipo di intelligenza: Visione (VLM)

La comprensione dei documenti. Legge fatture, contratti, moduli e scansioni, e non si limita a estrarne il testo: ne capisce la struttura — distingue l'imponibile dalla scadenza, la controparte dall'oggetto. È ciò che permette a Nova di lavorare sui documenti che l'azienda già riceve, senza doverli reinserire a mano.

Memoria sempre caldo

Tipo di intelligenza: Embedding semantico

L'archivio che ritrova per significato. Indicizza in continuazione i documenti trasformandoli in una rappresentazione che ne coglie il senso, non le parole esatte. Così una richiesta come «i contratti con rinnovo automatico» trova i documenti giusti anche quando quelle parole precise non compaiono. È la base della ricerca interna e del contesto su cui il Cervello ragiona.

Immagini a richiesta

Tipo di intelligenza: Diffusion

La generazione visiva. Produce immagini a partire da una descrizione, quando servono — un mockup, un'illustrazione per un documento. È l'unica intelligenza non sempre attiva: si carica al bisogno, perché serve solo occasionalmente e in quei momenti può prendere spazio in memoria senza sottrarlo alle altre.

Tutte le intelligenze sono a pesi aperti, con licenze permissive per l'uso commerciale, senza telemetria e interamente eseguibili offline. Girano tutte sull'ecosistema software maturo della piattaforma — la differenza tra un sistema che si aggiorna e uno che ogni sei mesi va rimesso in piedi.

FP4 nativo

Il modello gira nel formato per cui è stato addestrato.

Il motore di ragionamento è distribuito nativamente in FP4, e i Tensor Core Blackwell lo eseguono senza conversione. Nessuna riquantizzazione, nessuna perdita di qualità introdotta per farlo entrare in memoria: i pesi che arrivano sono i pesi che girano.

03La regola che governa la scelta

La velocità dipende dai parametri attivi, non da quelli totali.

Architettura MoE ~55 t/s molti parametri totali · pochi attivi per token
Architettura densa ~18 t/s stessi parametri totali · tutti attivi per token

Stessa dimensione dichiarata, tre volte la differenza di velocità. Il criterio di selezione è quindi uno solo: molti parametri totali, pochi attivi. Architetture MoE (Mixture of Experts), mai modelli densi — un denso da 70B striscia a 5–15 t/s, perché ogni token deve attraversare tutti i pesi e la banda di memoria diventa il collo di bottiglia.

04Budget di memoria

128 GB coerenti, di cui ~118 GB disponibili a intelligenze e contesto. L'intera catena operativa avviene senza mai scaricare un'intelligenza dalla memoria.

Voce Memoria Stato Note
Sistema operativo~10 GBfissoUbuntu ARM64, runtime, applicazione Nova
Cervello~63 GBsempre caldoRagionamento, orchestrazione, produzione documenti
Occhi~7 GBsempre caldoOCR e comprensione documenti
Memoria~1,2 GBsempre caldoIndicizzazione continua
Contesto (cache KV)~20 GBvariabilePiù generoso: il prefill veloce rende il contesto lungo davvero usabile
Totale residente~101 GBMargine libero: ~27 GB
Immagini~12 GBa richiestaEntra nel margine senza sfrattare nulla
Il margine in più

Restano circa 27 GB liberi — più che sulle piattaforme concorrenti, perché non serve riservare una quota fissa di memoria alla GPU: è tutta coerente e disponibile. È spazio per crescere: un contesto ancora più ampio, un'intelligenza aggiuntiva tenuta sempre calda, o i carichi di picco — senza dover sfrattare nulla dalla memoria.

Espandibilità

Due unità si collegano via ConnectX e mettono in comune la memoria: 256 GB coerenti, abbastanza per modelli che oggi non entrerebbero. È l'unico percorso di crescita disponibile in questa classe di macchine — e significa che l'acquisto non è una scommessa irreversibile.

05Sovranità del dato

ProprietàGaranzia
InferenzaInteramente locale. Nessuna chiamata a provider esterni.
Dati aziendaliNon lasciano mai la macchina. Documenti, gestionali e conversazioni restano su disco locale.
ApprendimentoCiò che Nova impara — regole, correzioni, tono — resta sulla macchina. Non addestra modelli di terzi.
Funzionamento offlineSì. Il sistema opera con il cavo di rete scollegato da internet.
TelemetriaNessuna richiesta dai modelli.
VerificabilitàOsservabile sulla rete del cliente: assenza di traffico in uscita durante l'inferenza.
La prova

Stacca il cavo di rete.
Nova continua a lavorare.

È la sola garanzia che conti davvero sui dati riservati: non una clausola contrattuale, ma un fatto che si verifica sulla propria rete in trenta secondi.

Vuoi vederla lavorare sui tuoi dati?

Mostraci il tuo gestionale e il ruolo che ti manca.