Sztuczna Inteligencja 6 min czytania

Dlaczego agenty AI zawodzą bez solidnych fundamentów danych?

W 2024 roku firmy konsultingowe obserwują gwałtowny wzrost wdrożeń agentów AI — jednak zdecydowana większość projektów nie dociera do etapu produkcyjnego nie przez błędy algorytmów, lecz przez chaotyczne, źle opisane dane. Niels Zeilemaker, globalny CTO Xebia, wskazuje wprost: agent AI jest tylko tak dobry, jak katalog danych, z którego korzysta. To przewartościowanie całej dyskusji o AI — bo dotąd branża koncentrowała się na modelach, a nie na infrastrukturze pod nimi.

Co to jest fundament danych dla agentów AI?

Fundament danych (ang. data foundation) to zbiór warstw infrastruktury — od przechowywania i integracji danych, przez ich dokumentację, aż po mechanizmy dostępu — które umożliwiają agentom AI samodzielne, bezbłędne operowanie na informacjach organizacji. Bez tej warstwy nawet najlepiej zaprojektowany agent nie jest w stanie działać poprawnie, bo nie wie, co dane oznaczają ani jak je łączyć.

Zeilemaker z Xebia w 2024 roku tłumaczył podczas AI & Big Data Expo, że problem rzadko leży w samym agencie. Leży w tym, co agent „widzi”: niekompletne opisy pól w bazie danych, niespójne nazewnictwo tabel, brak kontekstu biznesowego. Agent nie zadzwoni do kolegi, żeby zapytać, co oznacza dane pole — po prostu podejmie decyzję na podstawie tego, co ma.

Tradycyjne organizacje radziły sobie z niedoskonałą dokumentacją danych, bo zawsze był człowiek, który znał kontekst. Przejście na agentic AI — czyli systemy zdolne do autonomicznego działania i podejmowania decyzji — eliminuje ten bufor. To strukturalna zmiana w wymaganiach wobec całej warstwy danych.

Dlaczego katalog danych decyduje o sukcesie agentów AI?

Katalog danych (ang. data catalogue) to centralny rejestr zasobów danych organizacji: opisuje, co każdy zbiór danych zawiera, jak jest zbudowany, kto jest jego właścicielem i jak powinien być używany. Dla ludzi był narzędziem pomocniczym. Dla agentów AI staje się jedynym źródłem prawdy.

Zeilemaker precyzuje: jeśli opis w katalogu jest błędny lub niepełny, agent nie wykryje błędu — po prostu przyjmie go za fakt i będzie działał dalej. Konsekwencje mogą być poważne: agent może połączyć pola danych, które nigdy nie powinny być ze sobą zestawiane, generując fałszywe wnioski lub podejmując błędne decyzje procesowe.

Przykład z praktyki Xebia: organizacja miała dwa pola o podobnych nazwach w różnych systemach — jedno oznaczało przychód brutto, drugie marżę netto. Dla pracownika różnica była oczywista z kontekstu. Agent połączył je jako ekwiwalenty, co doprowadziło do błędnych rekomendacji cenowych. Błąd nie leżał w modelu — leżał w katalogu.

Redakcja IWD Partner: To przypomina sytuację, gdy nowy pracownik dostaje dostęp do systemu bez żadnego onboardingu i musi sam odkryć, co oznaczają poszczególne kolumny w Excelu. Tylko że agent AI nie zapyta o pomoc, nie domyśli się z kontekstu i nie nauczy się przez obserwację kolegów — po prostu popełni błąd na wielką skalę, szybko i cicho. Pytanie brzmi: ile firm zdaje sobie sprawę, że ich prawdziwy dług technologiczny siedzi właśnie w katalogu danych, a nie w jakości modeli?

Jak działa Agentic Data Foundation według Xebia?

Agentic Data Foundation (ADF) to koncepcja opracowana przez Xebia, która rozszerza tradycyjną platformę danych o warstwę hostującą agentów AI — zarówno do zastosowań wewnętrznych, jak i w kontaktach z klientami. ADF nie jest produktem pudełkowym, lecz metodologią wdrożeniową łączącą inżynierię danych z projektowaniem agentów.

Kluczowy element ADF to skrócenie czasu wdrożenia. Zeilemaker wskazał w 2024 roku, że standardowe projekty migracji danych zajmują od 12 do 24 miesięcy. Xebia, łącząc dedykowanych agentów AI z ekspercką inżynierią, kompresuje ten czas do znacznie krótszego okresu w ramach angażu o stałej cenie i zdefiniowanych kamieniach milowych.

Praktyczna wartość ADF polega na tym, że klient i konsultant wspólnie rozwijają rozwiązanie — Zeilemaker opisuje to jako co-development. Organizacje nie otrzymują gotowego systemu „do wdrożenia”, lecz budują go razem z Xebia, co oznacza transfer wiedzy i mniejszą zależność od zewnętrznego dostawcy w długim terminie.

Podejście Czas migracji Model pracy Ryzyko błędów agentów
Tradycyjna migracja danych 12–24 miesiące Klient zleca, dostawca dostarcza Wysokie (brak przygotowanego katalogu)
Xebia ADF z agentami AI Skompresowany (fixed-price) Co-development Niższe (katalog jako fundament wdrożenia)

Co to oznacza dla organizacji wdrażających AI?

Organizacje, które dziś inwestują w agentów AI bez wcześniejszego audytu jakości danych, budują na piasku. Zeilemaker z Xebia podkreśla, że błędy agentów wynikające z kiepskiej dokumentacji danych są trudne do wykrycia — agent nie zgłasza błędu, po prostu działa na podstawie błędnego założenia, generując wyniki, które wyglądają poprawnie.

Praktyczna implikacja jest konkretna: przed uruchomieniem jakiegokolwiek agenta AI w środowisku produkcyjnym organizacja powinna przeprowadzić przegląd katalogu danych pod kątem kompletności opisów, jednoznaczności definicji i poprawności relacji między zbiorami. To nie jest jednorazowe zadanie — katalog musi być utrzymywany na bieżąco.

Xebia obserwuje w 2024 roku rosnące zainteresowanie klientów migracją z legacy systems — starych, monolitycznych systemów danych — do nowoczesnych platform. Wcześniej głównym motywem był koszt utrzymania. Dziś coraz częściej motywem jest niemożność uruchomienia agentów AI na starych, nieudokumentowanych strukturach danych.

Dlaczego jakość danych dla agentów AI ma znaczenie?

Według prognoz analityków z Gartner z 2024 roku, do 2026 roku ponad 80% przedsiębiorstw z listy Fortune 500 będzie używać agentów AI w procesach operacyjnych. Jeśli nie rozwiążą wcześniej problemów z jakością i dokumentacją danych, skala błędów będzie proporcjonalna do skali wdrożeń.

Konsekwencje złej jakości danych dla agentów AI przekraczają typowe koszty „złych danych”. Człowiek, który popełni błąd na podstawie złych danych, popełnia go raz — agent AI powieli ten błąd tysiące razy dziennie w pełni zautomatyzowanym procesie, zanim ktokolwiek to zauważy.

Podejście Xebia do Agentic Data Foundation wpisuje się w szerszy trend, który MIT Sloan Management Review opisywał w 2023 roku jako „data-centric AI” — przesunięcie nacisku z optymalizacji modeli na optymalizację danych wejściowych. Firmy, które to zrozumieją jako pierwsze, zyskają realną przewagę — nie przez lepsze algorytmy, lecz przez lepiej przygotowaną infrastrukturę.

Powiązane pojęcia z AI i uczenia maszynowego

  • Agentic AI — klasa systemów sztucznej inteligencji zdolnych do autonomicznego planowania, podejmowania decyzji i wykonywania wieloetapowych zadań bez ciągłego nadzoru człowieka.
  • Katalog danych (Data Catalogue) — scentralizowany rejestr metadanych opisujący zasoby danych organizacji: ich strukturę, znaczenie, właściciela i sposób użycia.
  • Legacy system — przestarzały system informatyczny, często trudny w integracji z nowoczesnymi platformami ze względu na nieudokumentowane struktury danych i brak standardów.
  • Data-centric AI — podejście do tworzenia systemów AI, w którym główny nacisk kładzie się na jakość i dokumentację danych wejściowych, a nie wyłącznie na architekturę modelu.
  • Co-development — model współpracy, w którym dostawca i klient wspólnie projektują i budują rozwiązanie, zapewniając transfer wiedzy i zmniejszając zależność od zewnętrznego dostawcy.

Na podstawie materiałów źródłowych.