Budowanie produktów AI: evals, taste i wąskie gardła
Jak i kiedy użyć
Skopiuj tę checklistę do asystenta AI razem z opisem produktu AI, który budujesz albo planujesz. Poproś AI, żeby zaprojektowało stopniowe oddawanie autonomii w trzech wersjach: sugestie, generowanie z przeglądem człowieka i pełna autonomia, oraz żeby zbudowało prosty system evals: zbieranie outputów, ocena przez jedną osobę, kryteria i automatyczne metryki. Następnie niech AI wskaże, gdzie w Twoim procesie przesuwają się wąskie gardła, gdy AI pisze większość kodu, i co realnie poprawi jakość, czyli prompting, ewaluacja i strategia próbkowania zamiast samej wielkości modelu.
Checklista
Stopniowe oddawanie autonomii, Reganti i Badam
- Każde oddanie autonomii systemowi AI oznacza utratę kontroli, więc budujesz stopniowo.
- Wersja 1: sugestie, czyli wysoka kontrola człowieka.
- Wersja 2: generowanie z przeglądem człowieka.
- Wersja 3: pełna autonomia, do której nie skaczesz na starcie.
- Pain is the new moat: firmy, które przechodzą ból uczenia się AI teraz, budują trudną do dogonienia przewagę.
Evals jako kluczowa umiejętność, Hamel Husain i Shreya Shankar
- Evals to najważniejsza nowa umiejętność dla budujących produkty w erze AI, tym, czym metryki są dla tradycyjnych produktów.
- Proces: zbierasz outputy, jedna osoba, łagodny dyktator, ocenia je jako dobre albo złe, definiujesz kryteria, budujesz automatyczne metryki i iterujesz.
- Najczęstszy błąd to AI ocenia AI, bo to nie działa.
Myślenie ogrodnika zamiast budowniczego, Alex Komoroske
- Budowniczy: mam plan i realizuję plan, więc wynik jest mniejszy lub równy włożonemu wysiłkowi.
- Ogrodnik: sadzę, pielęgnuję i kierunkuję, więc wynik może przekroczyć wysiłek.
- LLM to rower elektryczny dla przestrzeni idei: pokrywasz 10 razy więcej terenu intelektualnego, ale musisz wiedzieć, dokąd jechać.
- W epoce AI taste, czyli smak, to zdolność tworzenia czegoś innego niż to, co model wygenerowałby sam.
Trzy ery internetu, Rauch i Soderstrom
- Era kuracji: użytkownik sam organizuje treści.
- Era rekomendacji: organizują algorytmy.
- Era generacji: AI tworzy treści, a każda era wymaga przebudowania doświadczenia i modelu biznesowego.
- Zasada godzin obserwacji: mierzysz, ile czasu spędzasz, obserwując użytkowników, bo im więcej, tym lepszy taste, który jest rozwijany, nie wrodzony.
Przesuwanie wąskich gardeł, Mike Krieger
- Gdy AI pisze 90 procent kodu, wąskie gardło przesuwa się w górę procesu, do uzgadniania decyzji, oraz w dół, do kolejki merge i review.
- Używasz modelu AI jako partnera strategicznego: do testowania pomysłów, pisania dokumentów i brainstormu.
- AI nie eliminuje pracy, tylko przesuwa wąskie gardła, więc organizacja musi identyfikować nowe wąskie gardła.
Co naprawdę poprawia aplikacje AI, Chip Huyen i Howie Liu
- Ludzie myślą, że jakość AI poprawia więcej danych i większe modele, a naprawdę działa lepszy prompting, evals i strategia próbkowania odpowiedzi.
- Strategia próbkowania odpowiedzi bywa ważniejsza niż wielkość modelu.
- Ćwiczenie refounding, Howie Liu: wyobraź sobie, że zakładasz firmę od zera w podejściu AI-native, a jeśli nie potrafisz odpowiedzieć jak, może lepiej znaleźć kupca.
- Full stack builder, Tomer Cohen: model trio product manager, designer, inżynier jest złamany, a przyszłość to pełnostackowi twórcy w małych zespołach wspierani przez AI, bo 70 procent umiejętności zmieni się do 2030.
Najczęstsze pytania
Czym są evals w produktach AI?
Evals to systematyczna ocena jakości outputów modelu, która dla produktów AI pełni rolę, jaką metryki pełnią dla tradycyjnych produktów. Proces wygląda tak: zbierasz outputy, jedna zaufana osoba ocenia je jako dobre albo złe, definiujesz kryteria, budujesz automatyczne metryki i iterujesz. Najczęstszym błędem jest pozwalanie AI oceniać AI, bo to po prostu nie działa.
Dlaczego nie oddawać AI pełnej autonomii od razu?
Bo każde oddanie autonomii systemowi oznacza utratę kontroli, a skok od razu do pełnej automatyzacji kończy się błędami i utratą zaufania użytkowników. Lepiej budować stopniowo: najpierw sugestie z pełną kontrolą człowieka, potem generowanie z przeglądem, a dopiero na końcu pełna autonomia. Firmy, które przechodzą ten ból uczenia się teraz, budują trudną do dogonienia przewagę.
Czym jest taste w budowaniu produktów AI?
Taste, czyli smak, to zdolność tworzenia czegoś innego i lepszego niż to, co model wygenerowałby sam z siebie. W metaforze ogrodnika i budowniczego to ogrodnik osiąga wynik większy niż włożony wysiłek, bo wie, dokąd kierować. Taste nie jest wrodzonym talentem, tylko umiejętnością rozwijaną przez godziny obserwowania, jak ludzie naprawdę używają produktów.
Co naprawdę poprawia jakość aplikacji AI?
Wbrew intuicji nie chodzi głównie o więcej danych ani większe modele, tylko o lepszy prompting, dobre evals i przemyślaną strategię próbkowania odpowiedzi. Często sposób, w jaki dobierasz i oceniasz odpowiedzi modelu, daje większy skok jakości niż przejście na większy model. Dlatego warto inwestować czas w prompting i ewaluację, zanim sięgniesz po droższy model.
Jak AI zmienia wąskie gardła w pracy?
Gdy AI pisze większość kodu, praca się nie kończy, tylko wąskie gardło się przesuwa. W górę procesu rośnie znaczenie uzgadniania decyzji i kierunku, a w dół kolejki przeglądu i scalania kodu. Dlatego organizacje muszą świadomie identyfikować nowe wąskie gardła i używać AI także jako partnera do testowania pomysłów i pisania dokumentów, nie tylko do kodu.
Źródła i odniesienia
Ten zasób jest autorskim opracowaniem praktycznym. Poniższe pozycje pokazują inspiracje i ramy, do których jawnie się odnosimy.