Dlaczego zbudowaliśmy własne rozwiązanie
Produkt zaczął się jako wewnętrzna odpowiedź na jakość automatycznie generowanych postów. Narzędzia takie jak Taplio i Buffer przyspieszały tworzenie treści, lecz tekst często brzmiał generycznie. Nie zachowywał też powtarzalnie indywidualnego stylu, ważnych słów ani oczekiwanego poziomu profesjonalnego.
Chcieliśmy procesu publikacji, w którym kontekst jest funkcją produktu, a nie długim promptem wklejanym do pola tekstowego. Pierwsze MVP powstało w Langflow z dodatkową bazą danych. Łączyło kontekst, generowanie, ocenę i informacje potrzebne w kolejnych cyklach publikacji.
Produkt później stał się częścią platformy CEE AI Hub dla organizatorów społeczności. Wyszedł więc poza pierwotne użycie wewnętrzne, zachowując główny cel: przygotowywać lepsze wersje robocze bez omijania akceptacji człowieka.
Ustalanie potrzebnego kontekstu
Najtrudniejsze nie było samo wygenerowanie posta. Musieliśmy ustalić, jakich informacji agent potrzebuje, aby tekst był rozpoznawalny i użyteczny. Przeprowadziliśmy ponad 20 iteracji projektu kontekstu. Na jednym etapie pięć wersji procesu działało równolegle, aby zebrać porównywalne informacje i poprawić jakość.
Zamiast długich badań teoretycznych zaczęliśmy od iteracji ze znajomymi i rodziną, a następnie z wczesnymi użytkownikami. Każda runda ujawniała brakujące dane, niejasne pytania i sygnały wpływające na ocenę tekstu.
Produkt przechowywał cele komunikacyjne, istotne słowa, plan publikacji i zaakceptowane przykłady. Ten kontekst wspierał proces redakcyjny oraz generowanie wersji roboczych. Użytkownik nadal odpowiadał za fakty, ostateczne brzmienie, akceptację i publikację.
Kalibracja zamiast pytania o ton
Otwarte pytanie „Jaki jest Twój ton głosu?” dawało niespójne odpowiedzi. Jedni opisywali osobowość, inni podawali przymiotniki, a część osób przekazywała informacje niezwiązane ze stylem pisania. Nie dało się zbudować z nich powtarzalnej struktury.
Zastąpiliśmy to podejście prowadzonym onboardingiem. Użytkownik przekazywał podstawowe informacje i próbki tekstu. System wyodrębniał cechy strukturalne z przykładów, zamiast polegać wyłącznie na deklaracji. Kalibracja pokazywała później warianty i prosiła o wskazanie wersji bardziej zbliżonej do użytkownika.
Wybór porównawczy był bardziej użyteczny niż otwarta odpowiedź albo ocena od jednego do pięciu. Dostarczał konkretny sygnał preferencji i nie wymagał znajomości terminologii pisarskiej. Ten sposób pozyskiwania danych był głównym elementem UX produktu dla marki osobistej.
Onboarding miał pozostać krótki, mimo że system potrzebował szczegółowego kontekstu. Dlatego porządkowaliśmy pytania w powtarzalne pola, a kalibrację rozkładaliśmy na łatwe wybory. Użytkownik nie musiał samodzielnie opisywać całej struktury swojego stylu. Produkt wyprowadzał ją z próbek i kolejnych decyzji, a następnie wykorzystywał w dalszym procesie.
Testowanie procesów, modeli i komponentów
Porównywaliśmy różne duże modele językowe, ponieważ jakość zależała zarówno od modelu, jak i kontekstu. Sprawdzaliśmy, czy tekst utrzymuje oczekiwany styl, zawiera wymagane słowa i unika wzorców klasyfikowanych przez zespół jako generyczna treść AI.
Po kolejnych usprawnieniach około 95% wyników spełniało te łączne kryteria w naszej wewnętrznej ocenie. Jest to wynik rozwoju produktu, a nie niezależny benchmark wszystkich funkcji Taplio lub Buffera. Nie dysponujemy publiczną liczebnością próby ani przedziałem ufności, dlatego nie przedstawiamy go jako ogólnej miary dokładności modelu.
Pierwsza orkiestracja działała w Langflow. Tworzyliśmy własne komponenty Langflow w Pythonie z użyciem LangChain, gdy standardowe bloki nie obsługiwały potrzebnego kontekstu albo zachowania. Interfejs powstał w Next.js, a aplikacja była self-hosted. Oddzielna baza danych utrzymywała kontekst między etapami procesu.
Potwierdzony rezultat i granice
Potwierdzonym rezultatem jest dostarczone wewnętrzne MVP rozwinięte przez ponad 20 iteracji kontekstu i pięć równoległych wariantów. Później produkt stał się częścią platformy CEE AI Hub dla organizatorów społeczności. Obejmował uporządkowany onboarding, analizę próbek, kalibrację przez wybór, generowanie tekstu, własne komponenty Langflow i self-hosted interfejs Next.js.
Wynik 95% opisuje wewnętrzną ocenę stylu, wymaganych słów i unikania zidentyfikowanych generycznych wzorców. Nie dowodzi wpływu na zaangażowanie odbiorców, częstotliwość publikacji, oszczędność czasu, wzrost społeczności ani przewagi we wszystkich zadaniach obsługiwanych przez inne platformy.
W podobnym produkcie punktem wyjścia są zaakceptowane przykłady, uporządkowane sygnały preferencji, kryteria oceny i kontrola użytkownika przed wyborem modelu. Powiązana strona o systemach agentowych pokazuje rolę kontekstu i wyboru działań w większym procesie.