Tworzenie sztucznej inteligencji do rysunków technicznych za pomocą Drawing2Data-Bench

29 września 2026 r.
·
Czas czytania: 8 minut
Adam G. Dobrakowski
Obserwuj na Linkedin
Rysunek techniczny zawiera znacznie więcej niż tylko obraz części. Opisuje on wymiary, tolerancje, otwory, gwinty, wykończenie powierzchni oraz instrukcje produkcyjne. Przekształcenie tych informacji w dane użytkowe oznacza znalezienie drobnych oznaczeń, ich prawidłowe odczytanie oraz zachowanie ich położenia na stronie. Ten ostatni wymóg ma duże znaczenie. System może poprawnie odczytać „50 ±0,2”, ale […]

Rysunek techniczny to znacznie więcej niż tylko obraz części. Zawiera on opisy wymiarów, tolerancji, otworów, gwintów, wykończenia powierzchni oraz instrukcje produkcyjne. Przekształcenie tych informacji w dane, które można wykorzystać, wymaga odnalezienia niewielkich oznaczeń, ich prawidłowego odczytania oraz zachowania ich położenia na stronie.

Ten ostatni wymóg ma znaczenie. System może odczytać 50 ± 0,2 poprawnie, ale umieścić go obok niewłaściwego elementu. W przypadku oprogramowania obsługującego procesy inżynieryjne lub związane z przygotowywaniem ofert sama liczba nie wystarczy.

Drawing2Data-Bench jest zestawem narzędzi firmy COGITA służącym do opracowywania i oceny rozwiązań opartych na sztucznej inteligencji w odniesieniu do tego problemu. Łączy on trzy etapy pracy: generowanie oznaczonych rysunków na podstawie plików CAD, testowanie modeli wizualno-językowych oraz szkolenie dedykowanego detektora.

Zdokumentowane eksperymenty wskazują na interesującą prawidłowość: modele ogólnego przeznaczenia są w stanie odtworzyć znaczną część tekstu, jednak precyzyjna lokalizacja pozostaje trudna. Specjalistyczny detektor RF‑DETR osiąga najwyższą precyzję wyznaczania prostokątów w opisanym porównaniu, podczas gdy Gemini 3.5 Flash osiąga najwyższy wskaźnik F1 dla prostokątów. Zrozumienie tej różnicy pomaga wyjaśnić, dlaczego zestaw narzędzi zawiera wszystkie trzy komponenty.

Co zawiera repozytorium

KomponentJak to działaDlaczego to ma znaczenie
pokolenie/Przekształca modele CAD 3D w rysunki 2D wraz z odpowiadającymi im opisami.Tworzy przykłady szkoleniowe bez konieczności ręcznego zaznaczania każdej adnotacji.
testy porównawcze/Uruchamia modele na rysunkach i analizuje ich ustrukturyzowane prognozy.Oddziela jakość wyodrębniania tekstu od możliwości lokalizowania adnotacji.
ekstrakcja/Obsługuje i eksploatuje detektor RF‑DETR typu Large.Zapewnia specjalistyczny model służący do wyszukiwania regionów adnotacji.

Proces rozpoczyna się od modelu CAD. Generator tworzy obraz wraz z etykietami odniesienia. Pary te można następnie wykorzystać zarówno do szkolenia detektora, jak i do oceny modeli na podstawie znanych odpowiedzi. Każdy element jest opisany w przegląd repozytorium.

1. Generowanie opatrzonych opisami rysunków 2D na podstawie modeli 3D CAD

Aby wyszkolić model obrazowy, potrzebne są przykłady tego, co ma on wykrywać. W przypadku rysunku technicznego może to oznaczać prostokąt otaczający wymiar, etykietę określającą rodzaj adnotacji oraz tekst umieszczony wewnątrz tego prostokąta.

Ręczne tworzenie tych oznaczeń zajmuje sporo czasu. Na jednej stronie może znajdować się kilkadziesiąt drobnych adnotacji, a osoba zajmująca się ich nanoszeniem musi rozumieć notację techniczną.

Generator repozytorium, AutoDraft, tworzy rysunek wraz z podpisami. Akceptuje STEP, IGES i BREP pliki zawierające geometrię 3D w formacie CAD. Program wykorzystuje tę geometrię do wybierania widoków, rysowania części, dodawania wymiarów i objaśnień oraz rozmieszczania ich na arkuszu. Wynikiem jest Obraz w formacie PNG oraz Adnotacje COCO. COCO to popularny format zbioru danych, w którym rejestruje się obiekty, ich kategorie oraz ich położenie na obrazie.

Generated technical drawing with reference annotation boxes in red

Wygenerowany rysunek wraz z etykietami odniesienia. Czerwone ramki pochodzą z rekordów adnotacji generatora; są to odpowiedzi, których detektor ma się nauczyć.

Program AutoDraft obsługuje 12 kategorii adnotacji, w tym wymiary, promienie, fazowania, otwory, gwinty, symbole wykończenia powierzchni, uwagi, tabele i podpisy widoków. Obejmuje on również GD&T, czyli geometryczne wymiarowanie i tolerancje, oraz punkty odniesienia, elementy odniesienia służące do określania wymiarów i tolerancji.

Adnotacja zawiera kategorię, tekst oraz ramkę ograniczającą. Dodatkowe pola zawierają takie informacje, jak zmierzona wartość, widok oraz informację, czy specyfikacja została wygenerowana sztucznie. Większość ramek skupia się na samej adnotacji, a nie na jej największym wymiarze lub linii wskaźnikowej wokół niej. Tabela jest przedstawiona za pomocą jednej ramki otaczającej cały blok.

Różnorodność pomaga modelowi nauczyć się więcej niż jednego układu

Program AutoDraft oferuje dziesięć stylów rysunkowych, charakteryzujących się różnymi układami arkuszy, rodzajami grotów strzałek, sposobami rozmieszczenia tekstu, tolerancjami oraz polami tytułowymi. Umożliwia on tworzenie widoków przekrojowych ukazujących elementy wewnętrzne, powiększonych widoków szczegółowych oraz oddzielnych widoków elementów w zespole. Szczegóły prezentacji różnią się również w obrębie danego stylu.

Ma to znaczenie, ponieważ model wytrenowany na jednym stałym układzie może nauczyć się rozpoznawać miejsca, w których zazwyczaj pojawiają się etykiety, zamiast nauczyć się je rozpoznawać. Szerszy zakres układów zapewnia programistom lepszy punkt wyjścia do trenowania modeli przetwarzających rysunki 2D.

Etykiety zawierają tekst, więc wygenerowane dane mogą również posłużyć do przyszłego dostrajania modeli OCR lub modeli wykorzystujących przetwarzanie obrazu i języka. Kod szkoleniowy udostępniony obecnie w tym repozytorium skupia się na wykrywaniu obiektów.

Należy pamiętać o jednym rozróżnieniu: niektóre specyfikacje mają charakter syntetyczny. Wartości dotyczące wykończenia powierzchni są generowane, a niektóre inne adnotacje mogą być generowane, gdy plik CAD nie zawiera osadzonych informacji produkcyjnych. Elementy te są oznaczone. Mogą one wskazać modelowi, jak wygląda dany symbol lub etykieta, ale ich wygenerowane wartości nie powinny być traktowane jako rzeczywiste wymagania dotyczące oryginalnej części. Zobacz dokumentacja dotycząca generacji w celu zapoznania się z obsługiwanymi standardami i ograniczeniami.

2. Sprawdź, jakie dane faktycznie pozyskują Gemini i GPT

A model wizyjno-językowy, czyli VLM, obsługuje zarówno obrazy, jak i tekst. Drawing2Data-Bench zawiera adaptery do modeli Gemini i GPT za pośrednictwem OpenRouter, a także lokalny detektor.

W ramach testu porównawczego każdy model VLM ma za zadanie zwrócić ustrukturyzowane cechy: tekst adnotacji, kategorię, prostokąt ograniczający oraz poziom pewności. Wyniki prognoz są zapisywane w formacie JSON, a następnie porównywane z etykietami referencyjnymi. Konfiguracja w formacie YAML określa zbiór danych, modele, metryki oraz liczbę próbek.

Dzięki temu można zadać trzy odrębne pytania:

  1. Czy model znalazł adnotację? Jego przewidywany prostokąt musi w wystarczającym stopniu pokrywać się z prostokątem odniesienia.
  2. Czy poprawnie odczytało i sklasyfikowało adnotację? Tekst i kategoria muszą być zgodne.
  3. Czy obie te rzeczy miały miejsce w tym samym miejscu? Tekst, kategoria i pozycja muszą być poprawne.

W przypadku dopasowywania pól test porównawczy wykorzystuje przecięcie nad sumą, czyli IoU: pole wspólne dla dwóch prostokątów podzielone przez całkowite pole przez nie zajmowane. Aby uznać dopasowanie za prawidłowe, wartość IoU musi wynosić powyżej 0,5. Dzięki temu ocena jest bardziej rygorystyczna niż zwykłe sprawdzenie, czy prostokąt znajduje się gdzieś w pobliżu właściwej liczby.

Przedstawione porównanie

W dokumentacji testu porównawczego odnotowano przebieg o nazwie benchmark_15, wykorzystując 15 wygenerowanych rysunków. Poniższa tabela przedstawia wyniki lokalizacji. Wszystkie trzy wyniki są lepsze, im wyższe.

ModelDokładność obliczeńWycofanie produktu z rynkuPole F1
Lokalny detektor RF‑DETR (niestandardowy)0.97770.60500.7474
Gemini 3.1 Flash Lite0.65250.63810.6453
Gemini 3.5 Flash0.77620.75690.7664
GPT-5.6 Luna*0.20660.20290.2047
GPT-5.6 Terra0.53630.36740.4361
GPT-5.6 Sol0.54300.55800.5504

Źródło: udokumentowane wyniki testów porównawczych. Wyniki Luny obejmują 14 wyników, ponieważ jedna odpowiedź przekroczyła limit długości wyniku. Nazwy modeli są zgodne z nazwami w repozytorium.

Precyzja podaje, jaka część przewidywanych pól pokrywa się z adnotacjami referencyjnymi. Przypomnij sobie informuje nas, jaka część bazy adnotacji referencyjnych została odnaleziona. F1 łączy te dwa podejścia, więc model nie może osiągnąć wysokiego wskaźnika F1 wyłącznie poprzez zwracanie kilku bardzo precyzyjnych prostokątów.

Dokładność detektora lokalnego wynosząca 97.77% jest wyższy niż w przypadku każdego modelu VLM w tej serii. Jego współczynnik odtworzenia 60.50%, jednakże, pokazuje, że wciąż pomija wiele adnotacji. Gemini 3.5 Flash wykrywa ich więcej i osiąga najlepszą równowagę między precyzją a odzyskiem.

W tych zestawieniach wyników nie uwzględnia się tekstu ani kategorii. Prawidłowo zlokalizowany prostokąt może zostać uznany za trafienie, nawet jeśli nie zawiera tekstu lub ma nieprawidłową klasę.

Czytanie tekstu to tylko część problemu

Wskaźniki cech uwzględniają w ocenie tekst oraz kategorię. Pierwsza kolumna poniżej nie bierze pod uwagę pozycji; druga wymaga ponadto, aby adnotacja znajdowała się we właściwym miejscu.

VLMDokładny tekst + kategoria F1Dokładny tekst + kategoria + lokalizacja F1
Gemini 3.1 Flash Lite0.83520.5922
Gemini 3.5 Flash0.86150.6797
GPT-5.6 Luna*0.82790.1869
GPT-5.6 Terra0.72460.4033
GPT-5.6 Sol0.85290.5041

Źródło: to samo wyniki testów porównawczych, z tym samym wyjątkiem dotyczącym 14 wyników w przypadku Luny. Dokładne dopasowanie polega na porównaniu zapisanych treści i kategorii. Funkcje tabeli wykorzystują etykiety, takie jak BLOK TYTUŁOWY; w tym przebiegu nie jest sprawdzana transkrypcja każdej komórki tabeli.

Każdy model traci na znaczeniu, gdy lokalizacja staje się jednym z wymagań. W przypadku Gemini 3.5 Flash wynik spada z od 0,8615 do 0,6797. W przypadku GPT-5.6 Sol wartość ta spada z od 0,8529 do 0,5041.

Ta rozbieżność stanowi najbardziej przydatny wniosek dla programistów. Model może zwrócić wiele poprawnych etykiet, nie umieszczając ich jednak w sposób wiarygodny na rysunku. Przekonująca odpowiedź tekstowa nie stanowi zatem dowodu na to, że rysunek został poprawnie wyodrębniony. Nawet prawidłowe umiejscowienie adnotacji to jedynie jeden krok w kierunku powiązania każdej etykiety z fizyczną cechą, którą opisuje.

Predicted annotation boxes from six models on the same generated drawing

Porównanie sześciu modeli na jednym rysunku, udostępnione w repozytorium. Są to prognozy modeli, a nie ramki odniesienia. Panele ilustrują różnice w zasięgu i rozmieszczeniu; powyższe tabele zawierają podsumowanie zgłoszonego przebiegu.

3. Wyszkol dedykowany detektor RF‑DETR

Ten wydobycie zastosowania komponentu RF‑DETR – duży, detektor obiektów wyszkolony do wykrywania i klasyfikowania obszarów oznaczonych adnotacjami.

Jego zadaniem jest zwracanie ramek wokół obiektów, takich jak wymiary, adnotacje i tabele. Nie dokonuje transkrypcji ich tekstu. Adapter testowy zwraca puste pole tekstowe dla każdego wykrytego elementu, co wyjaśnia zerowe wyniki detektora w zakresie podanych wskaźników tekstowych.

W dokumentacji dotyczącej ekstrakcji opisano wygenerowany zbiór danych zawierający 9 378 obrazów i 228 327 adnotacji, w następującym podziale:

SplitZdjęciaAdnotacje
Szkolenie6,513158,727
Walidacja1,88645,942
Test97923,658

Przykłady szkoleniowe służą do uczenia modelu; przykłady walidacyjne pozwalają śledzić jego postępy; przykłady testowe są odkładane na bok w celu oceny. Liczby dotyczące tych zbiorów danych odnoszą się do udokumentowanych prac szkoleniowych, natomiast w powyższym porównaniu modeli VLM wykorzystano odrębną konfigurację testową obejmującą 15 próbek.

W opisanym przebiegu szkolenia wykorzystano 20 epok, co oznacza 20 przejść przez dane szkoleniowe. Skrypt szkoleniowy stosuje również przekształcenia, takie jak obrót, zniekształcenie perspektywiczne, rozmycie, szum i kompresja, aby detektor miał do czynienia z obrazami o gorszej jakości.

RF‑DETR training curves showing improving validation scores and decreasing loss

Wraz z repozytorium dostarczono zarejestrowane krzywe szkoleniowe. Wyniki wykrywania poprawiają się w trakcie przebiegu, podczas gdy wskaźniki błędu szkoleniowego i walidacyjnego zasadniczo maleją.

W dokumentacji podano, że przeprowadzono końcową walidację mAP@50 wynoszące 0,9352 oraz mAP@50:95 wynoszące 0,7245 dla uśrednionych wag modelu. Są to wyniki wykrywania obiektów: drugi z nich ocenia dopasowanie prostokątów przy różnych, coraz bardziej rygorystycznych wymaganiach dotyczących nakładania się. Wyniki te pochodzą z innego zestawu testowego i należy je traktować oddzielnie od wyników F1 z małego zestawu testowego. dokumentacja dotycząca wydobycia zawiera pełne ustawienia treningowe oraz wyniki poszczególnych zajęć.

RF‑DETR predictions on a generated technical drawing

Ten samodzielny przykład wnioskowania zawiera 14 wykrytych obszarów przy progu ufności wynoszącym 0,5. Przedstawia on wykryte obszary bez transkrypcji OCR. Jest to przykład niezależny od powyższego porównania sześciu modeli.

W przedstawionym teście porównawczym detektor osiąga lepsze wyniki niż cztery z pięciu modeli VLM w zadaniu F1 oraz niż wszystkie pięć w zadaniu precyzyjnym. Potwierdza to praktyczny kierunek dalszych prac: wykorzystanie wyspecjalizowanego modelu do wyszukiwania obiecujących obszarów, a następnie przekazanie tych wyodrębnionych fragmentów do OCR lub modelu VLM w celu odczytania. Repozytorium udostępnia detektor oraz narzędzia ewaluacyjne; kolejnym krokiem pozostaje stworzenie zintegrowanego procesu odczytu.

Jak wypróbować zestaw narzędzi

Zacznij od sklonowania repozytorium i zainstalowania jego zależności:

git clone https://github.com/COGITA‑AI/drawing2data-bench.git
cd drawing2data-bench
python -m pip install -r requirements.txt

Wygeneruj niewielki zbiór danych na podstawie dołączonych przykładów CAD:

python -m generation.cli "generation/examples/models/*.step" -o dataset

Przed rozpoczęciem szkolenia sprawdź wygenerowane etykiety:

python -m generation.tools.coco_view dataset/train

Jeśli dysponujemy odpowiednim zbiorem danych i procesorem graficznym z obsługą CUDA, punktem wyjścia do szkolenia jest:

python -m extraction.train \
  --dataset-dir ./dataset \
  --epochs 20 \
  --batch-size 8 \
  --grad-accum-steps 2

Dostarczony skrypt szkoleniowy wybiera bezpośrednio CUDA. Kilka dołączonych przykładów CAD jest przydatnych do zapoznania się z generatorem; odtworzenie udokumentowanych wyników szkolenia wymaga większego zbioru danych i odpowiedniej konfiguracji.

W celu oceny VLM, przewodnik po testach porównawczych wyjaśnia konfigurację oraz OPENROUTER_API_KEY ustawienie. Polecenia testów porównawczych uruchamiane z testy porównawcze/. Wygenerowany zbiór danych testowych ma swoją przewidywaną lokalizację, benchmarks/zbiory danych/wygenerowane/dane/; samo utworzenie zbioru danych szkoleniowych nie powoduje jego wypełnienia.

Repozytorium zawiera link do wspólny folder z plikami w przypadku większych plików. Sprawdzona kopia repozytorium Git zawiera kod źródłowy, przykładowe pliki CAD, dokumentację i ilustracje, ale nie obejmuje pełnego zbioru danych szkoleniowych, punktów kontrolnych ani surowych danych benchmark_15 wyniki.

Co wynikają z tych wyników

Drawing2Data-Bench stanowi konkretny punkt wyjścia do generowania danych szkoleniowych i oceny konkretnych zadań związanych z rozumieniem rysunków. Przedstawione wyniki pokazują, dlaczego jakość tekstu, precyzja lokalizacji i zakres adnotacji wymagają odrębnej oceny.

Obecne dane mają również wyraźne ograniczenia. W porównaniu wykorzystano niewielką próbkę syntetyczną, a dokumentacja wskazuje na słabą przenoszalność detektora na rzeczywiste wydrukowane rysunki. Wszystkie modele VLM korzystają ze wspólnego promptu i konwencji współrzędnych, więc jest to porównanie przeprowadzone w ramach tej konfiguracji. Zastosowanie innych podpowiedzi lub inne przetwarzanie wstępne mogłyby zmienić ranking. Dane liczbowe przedstawione w niniejszym artykule odzwierciedlają eksperymenty udokumentowane w repozytorium; nie zostały one ponownie przeprowadzone niezależnie na potrzeby tego artykułu. Nowe odtworzenie eksperymentów powinno również zweryfikować skalowanie współrzędnych i mapowanie kategorii w obecnych adapterach.

Dla zespołów tworzących oprogramowanie inżynierskie zestaw narzędzi ten pozwala w praktyce przeprowadzić kolejne eksperymenty: generować przykłady, sprawdzać etykiety, porównywać modele na reprezentatywnych rysunkach oraz mierzyć, co ulega poprawie po połączeniu funkcji wykrywania i odczytu tekstu.

Zapoznaj się z kodem i dokumentacją w Repozytorium Drawing2Data-Bench firmy COGITA.

Spis treści
Pobierz nasz ebook
Otrzymuj najnowsze informacje na temat AI i Data Science.
Pobierz

Gotowy, aby stworzyć własny system AI?

Powiązane artykuły

Warto również przeczytać...

Polskie biuro
COGITA Sp. z o.o.
ul. Łąkowa 4
42-282 Widzów, Polska
UK Office
COGITA.AI Limited
93 Tanorth Road
Bristol, BS14 0NT, Anglia
Usługi
Rozwiązania
Zasoby
Cogita