Energent ha ottenuto un punteggio superiore al miglior risultato pubblicato citato in quattro dei cinque benchmark pubblici per documenti di ingegneria. Ogni punteggio proviene dal sistema di valutazione originale del benchmark, eseguito senza modifiche.
In breve
- Energent guida DrawingVQA, BlueprintSymVL, CircuitSense e CADBench.
- In CircuitSense, Energent ottiene il 69,6% contro il 12,3%. In BlueprintSymVL raggiunge il 74,0% contro il 50,5%.
- I risultati valutano l’intero flusso agentico di Energent, inclusa la capacità di ritagliare, riesaminare ed eseguire codice.
Contesto
La comprensione dei documenti di ingegneria comprende competenze diverse. Disegni di costruzione, P&ID, diagrammi circuitali e programmi CAD richiedono output differenti e usano metodi di valutazione specifici.
Abbiamo eseguito Energent su cinque benchmark pubblici usando l’implementazione di valutazione originale di ciascuno. Presentiamo ogni risultato separatamente per mantenere il significato della sua metrica nativa.
Ogni benchmark usa una propria metrica su una scala da 0 a 100; ogni riga costituisce quindi un confronto autonomo.
Risultati
| Dominio | Benchmark e metrica | Energent | Miglior risultato pubblicato |
|---|---|---|---|
| Disegni di costruzione | DrawingVQA — accuratezza visual QA | 89,1% | 77,2% (Gemini-3-pro) |
| Processi e tubazioni | BlueprintSymVL — corrispondenza esatta dei simboli P&ID | 74,0% | 50,5% |
| Elettronica analogica | CircuitSense — derivazione simbolica verificata | 69,6% | 12,3% |
| CAD meccanico | CADBench — Aligned IoU | 55,3% | 45,1% (Claude Opus 4.7) |
| CAD meccanico | BenchCAD — punteggio QA delle parti | 52,6% | 58,7% |
DrawingVQA: 89,1% contro 77,2%
DrawingVQA valuta domande visive sui disegni di costruzione. Energent ottiene 89,1%, rispetto al 77,2% di Gemini-3-pro nell’attuale classifica del dataset.
Il paper riporta riferimenti umani del 78,2% per un giovane professionista e del 94,9% per un professionista esperto. Il risultato di Energent usa un voto di maggioranza su tre esecuzioni.
BlueprintSymVL: 74,0% contro 50,5%
BlueprintSymVL misura il riconoscimento dei simboli nei disegni di ingegneria e nei P&ID. Energent raggiunge il 74,0% di corrispondenza esatta, contro il miglior risultato single-turn di un modello visione-linguaggio del paper, pari al 50,5% nelle Tabelle 2–5. Il dataset è pubblico.
CircuitSense: 69,6% contro 12,3%
CircuitSense verifica se un sistema può passare da un diagramma circuitale a una derivazione simbolica verificata. Energent ottiene 69,6%, rispetto al riferimento pubblicato del 12,3% nella Tabella 6, riponderato sulla nostra composizione dei livelli. Il dataset è disponibile con licenza MIT.
CADBench: 55,3% contro 45,1%
CADBench valuta la generazione di programmi per il CAD meccanico. Energent raggiunge il 55,3% di Aligned IoU, rispetto a un riferimento pubblicato del 45,1% di Claude Opus 4.7.
Il risultato copre quattro delle sei famiglie CADBench. Riponderiamo i valori pubblicati per strato della Tabella 5 sulle stesse quattro famiglie, mantenendo coerente il campo di valutazione. Il dataset è disponibile con licenza MIT.
BenchCAD: 52,6% contro 58,7%
BenchCAD valuta domande visive su parti CAD meccaniche. Energent ottiene 52,6% nel campo Vision-QA, insieme al risultato pubblicato del 58,7% nella classifica del repository. Il dataset è pubblico.
Metodologia
Per ogni benchmark, abbiamo incorporato il sistema di valutazione a un commit fissato e lo abbiamo eseguito senza modifiche. L’estrazione è nostra; il punteggio è del benchmark.
La valutazione misura il sistema agentico completo di Energent. Energent può ritagliare un disegno, riesaminare una regione ed eseguire codice durante il ragionamento; i dati pubblicati citati forniscono i riferimenti di modello per ciascun benchmark.
Conclusione
Tra disegni di costruzione, P&ID, diagrammi circuitali e CAD meccanico, Energent supera il miglior risultato pubblicato citato in quattro benchmark su cinque. I risultati dimostrano il valore di un flusso agentico per comprendere documenti di ingegneria complessi.
