Energent fikk høyere poeng enn det siterte beste publiserte resultatet i fire av fem offentlige benchmarktester for tekniske dokumenter. Hver poengsum kommer fra benchmarkens opprinnelige scorer, kjørt uendret.
Kort fortalt
- Energent leder i DrawingVQA, BlueprintSymVL, CircuitSense og CADBench.
- CircuitSense: 69,6 % mot 12,3 %. BlueprintSymVL: 74,0 % mot 50,5 %.
- Resultatene måler hele Energents agentbaserte arbeidsflyt, inkludert beskjæring, ny inspeksjon og kjøring av kode.
Kontekst og resultater
Byggetegninger, P&ID, koblingsskjemaer og CAD-programmer krever ulike resultater og bruker hver sin metrikk fra 0 til 100. Hver rad er derfor en selvstendig sammenligning.
| Område | Benchmark og metrikk | Energent | Best publisert |
|---|---|---|---|
| Byggetegninger | DrawingVQA — visuell QA-nøyaktighet | 89,1 % | 77,2 % (Gemini-3-pro) |
| Prosess og rør | BlueprintSymVL — nøyaktig P&ID-symbolmatch | 74,0 % | 50,5 % |
| Analog elektronikk | CircuitSense — verifisert symbolsk utledning | 69,6 % | 12,3 % |
| Mekanisk CAD | CADBench — Aligned IoU | 55,3 % | 45,1 % (Claude Opus 4.7) |
| Mekanisk CAD | BenchCAD — del-QA-score | 52,6 % | 58,7 % |
De enkelte benchmarkene
DrawingVQA tester visuelle spørsmål om byggetegninger. Energent får 89,1 % mot 77,2 % på den aktuelle resultatlisten. Resultatet bruker flertallsavstemning over tre kjøringer; de menneskelige referansene er 78,2 % og 94,9 %.
BlueprintSymVL måler symbolgjenkjenning i tegninger og P&ID. Energent når 74,0 % nøyaktig treff mot 50,5 % i tabell 2–5. Datasettet er offentlig.
CircuitSense tester veien fra koblingsskjema til verifisert symbolsk utledning. Energent får 69,6 % mot en nivåvektet referanse på 12,3 % fra tabell 6. Datasettet har MIT-lisens.
CADBench måler programgenerering for mekanisk CAD. Energent når 55,3 % Aligned IoU mot 45,1 % for Claude Opus 4.7. Resultatet dekker fire av seks familier og vekter tabell 5 på nytt over de samme familiene. Datasettet har MIT-lisens.
BenchCAD tester visuelle spørsmål om mekaniske CAD-deler. Energent får 52,6 % sammen med 58,7 % på resultatlisten i repositoriet. Datasettet er offentlig.
Metode
Vi hentet hver scorer ved en fast commit og kjørte den uendret. Uttrekket er vårt, poengsettingen er benchmarkens. De siterte publiserte tallene er modellreferanser for Energents komplette agentbaserte system.
Konklusjon
Energent leder det siterte beste publiserte resultatet i fire av fem benchmarktester og viser verdien av en agentbasert arbeidsflyt for komplekse tekniske dokumenter.
