Obejrzyj nagranie z webinaru:
AI dla Marki: GenMedia i Veo w Twojej firmie
Czego się dowiesz?
Obejrzyj nagranie webinaru poświęconego praktycznemu wykorzystaniu zaawansowanych modeli generatywnej sztucznej inteligencji – GenMedia z rodziny Google Cloud. Eksperci: Mariusz Wilczek z FOTC oraz Zuzanna Bychawska z Google Cloud przedstawiają możliwości platformy Vertex AI Studio oraz flagowych modeli AI: Veo (generowanie wideo z fizyką i dźwiękiem), Imagen / Gemini 3 Pro (zaawansowane grafiki, spójność postaci, wiedza o świecie), Lyria (muzyka na życzenie) oraz Chirp (naturalne głosy AI). Dowiesz się, jak tworzyć angażujące materiały dla marki, znacząco obniżając koszty i czas produkcji mediów.
TRANSKRYPCJA WEBINARU
AI dla Marki: GenMedia i Veo w Twojej firmie
Prelegenci:
Zuzanna Bychawska (Google)
Mariusz Wilczek (FOTC)
Data: 12.02.2026
Mariusz Wilczek: Dzień dobry wszystkim. Witamy na webinarze AI dla marki Generative Media w Twojej firmie. Ja jestem Mariusz Wilczek, content marketing specialist w FOTC. Ze mną dzisiaj jest Zuzanna Bychawska, skilled customer engineer w Google Cloud. No i nasz dzisiejszy webinar podzieliliśmy sobie na takie dwie części. Ja będę zajmował się takim wprowadzeniem teoretycznym, a Zuza włączy się krótko po mnie, żeby opowiedzieć trochę o praktycznych zastosowaniach AI. Dodam jeszcze, że na końcu webinaru przygotowaliśmy sobie krótką sesję Q&A, więc w razie gdy pojawiły się jakieś pytania, no to pod koniec będziemy mieli chwilę, żeby sobie na nie poodpowiadać.
Zanim jeszcze przejdę do tematu webinaru, chciałbym krótko opowiedzieć o FOTC. Ogólnie mówiąc, zajmujemy się dostosowywaniem i wdrażaniem rozwiązań chmurowych oraz AI. Jesteśmy premier partner Google Cloud, dlatego wdrażamy też digital workspace, cloud i projekty data. Także zajmujemy się integracją AI w firmach. No i na rynku działamy już od około dekady wspierając firmy z około 50 krajów. Przejdźmy sobie do tematu.
Generatywna sztuczna inteligencja dzisiaj
Przejdźmy sobie do tematu. W zasadzie tak na wstępie możemy powiedzieć o tym, w jakim obecnie stanie jest generatywna sztuczna inteligencja. Można przyznać, że te wszystkie treści, które są przez nią generowane, powoli zaczynają być na tyle realistyczne i trudne do odróżnienia w internecie.
Jeżeli ktoś przegląda treści w internecie, to na pewno może zauważyć, że coraz trudniej jest odróżnić to, co zostało wygenerowane przez AI, od tego, co zostało stworzone przez człowieka. Przynajmniej ja czasem muszę się troszeczkę dłużej nad tym zastanowić. Co za tym idzie, ta generatywna inteligencja mocno przyspieszyła tworzenie treści i zdemokratyzowała je, ponieważ wiele osób, które wcześniej nie miały umiejętności, aż żeby tworzyć różnego rodzaju obrazy, wideo czy muzykę, teraz w zasadzie jest w stanie to zrobić z poziomu kilku promptów. W związku z tym będziemy sobie dzisiaj rozmawiać o tych modelach AI.
W tym webinarze skupimy się na modelach Gen Media, które są dostępne w ramach Google Cloud.
Przedstawienie Vertex AI i modele GenMedia
Zanim opowiem i przedstawię już te konkretne modele, chciałbym jeszcze powiedzieć troszeczkę o Vertex AI, ponieważ to właśnie w ramach tej technologii te modele będą dostępne do wykorzystywania. Jest to zunifikowana platforma, środowisko Google Cloud, która składa się z czterech obszarów:
- Agent i Model Builder, czyli platformę do szybkiego budowania i skalowania agentów i modeli.
- Model Garden, czyli centrum dowodzenia modelami, w którym możemy sobie wybierać konkretne modele, na przykład od Google, jakieś rozwiązania open source czy modele, które są dostępne w ramach partnerstwa z Google Cloud.
- AI Hypercomputer, czyli – krótko mówiąc – dostęp do tej potężnej mocy obliczeniowej, którą oferuje Google.
W ramach Vertex AI mamy dostęp do czterech flagowych modeli. Jest to Veo, który generuje wideo. Mamy Imagen, który generuje obrazy, Lyria do generowania muzyki oraz Chirp do generowania głosu. Te modele będą naszym fundamentem w tworzeniu kreatywnych treści. Później, tak jak wspomniałem, Zuza pokaże troszeczkę, jak one działają faktycznie na żywo.
Omówienie Gemini 2.5 Flash Image
Omówimy sobie te modele i zaczniemy od popularnego modelu Gemini 2.5 Flash, który nosi też dźwięczną nazwę Nano-Banana. Jest to model dosyć dobry do codziennych, szybkich zastosowań. Wydaje mi się, że jeżeli ktoś korzysta z Gemini, to mógł na pewno tworzyć treści wizualne przy pomocy tego modelu.
W czym on się najlepiej spisuje? Możemy od razu powiedzieć, że jest to text-to-image, czyli przetworzenie prompta tekstowego na obraz. Tak jak widać na przykład na slajdzie, mamy tutaj przykład plakatów, które zostały wytworzone na podstawie opisania tego, co chcielibyśmy, aby się na nich znalazło. Otrzymujemy gotowy obraz. Dodatkowo mamy transferowanie stylu – kiedy mamy wizerunek osoby na zdjęciu i chcemy ją przenieść na jakiś styl obrazu, to możemy dokonać takiego połączenia i stworzymy spójny obrazek w tym jednym wiodącym stylu. Mamy obsługiwanie kompozycji z wielu obrazów, czyli na przykład zdjęcie modelki, do tego zdjęcie kota, psa i tworzy nam się taka jedna kompozycja z tymi wszystkimi elementami.
Dodatkowo mamy poza samym text-to-image też image plus text-to-image, czyli prompt tekstowy wraz z dodatkowym obrazem – na przykład gdy chcemy odtworzyć na podstawie czaszki wygląd człowieka pierwotnego. Warto wspomnieć, że modele te są w stanie dobrze utrzymać spójność postaci. Kiedy mamy jakąś postać na zasadzie maskotki firmy albo modelki, którą chcemy utrzymać w tym samym wyglądzie przez wiele zdjęć, na przykład w kampanii na social media, to ten model jest w stanie dobrze się z tej roli wywiązać.
Przedstawienie możliwości Gemini 3 Pro
Kolejnym, troszeczkę bardziej zaawansowanym modelem jest Gemini 3 Pro, nazywany również Nano-Banana Pro.
Co on oferuje? To między innymi zaawansowana kompozycja. Mamy tutaj możliwość zebrania aż do 14 obrazów referencyjnych, z których moglibyśmy stworzyć jeden obraz. Mamy tutaj prompt tekstowy, który układa nam te elementy, oraz zbiór elementów, które chcielibyśmy, żeby znalazły się na ostatecznej grafice – modelka, torebka, ubrania, dodatki, tło, kubek matchy w ręce i psiak. Tworzy nam się grafika, która śmiało mogłaby zostać opublikowana na social mediach.
Kolejną ciekawą możliwością Gemini 3 Pro jest jego wiedza o świecie. Dzięki połączeniu z wyszukiwarką Google model jest w stanie zrozumieć to, co mu wyślemy na zdjęciu. Przykładowo wysyłamy zdjęcie Palace of Fine Arts w San Francisco z prośbą o stworzenie infografiki – w prompcie nie musieliśmy dodawać szczegółów, on jest w stanie sam to wszystko opisać i wskazać, w którym miejscu konkretne elementy się znajdują.
To samo tyczy się innych treści – gdybyśmy chcieli stworzyć inne architektoniczne infografiki albo związane z biologią, ten model będzie w stanie dopowiedzieć trafne opisy do tych zdjęć.
Przejdźmy teraz do bardziej dynamicznego modelu. Jest to Veo, o którym spora część z was słyszała. Jest to model do generowania wideo, który pozwala na tworzenie zsynchronizowanego obrazu i dźwięku przy jednym prompcie. Postacie są w stanie mówić w wielu językach, a ruch ust jest zsynchronizowany bardzo naturalnie.
Model wykazuje się zrozumieniem fizyki – gdy chcemy zrobić klip nad jeziorem czy basenem, fizyka wody jest dobrze zachowana. Mamy też możliwości generowania wideo typu pierwsza i ostatnia klatka – mamy zdjęcie na początku oraz zdjęcie klatki końcowej, a model jest w stanie pomiędzy nimi dopowiedzieć resztę historii i wychodzi to całkiem spójnie. Tak jak w przypadku pojedynczych zdjęć, tak tutaj mamy możliwość stworzenia wideo na bazie paru zdjęć – modelki, jej ubrania i tła – co tworzy spójny obraz.
Pokażmy przykład wygenerowany przy pomocy Veo. Jest to wideo wytransmitowane podczas finałów NBA. Koszt tego wideo to 2000 dolarów. Wykonane zostało przez jedną osobę, której zajęło to do trzech dni. Żeby stworzyć takie wideo, trzeba było wcześniej wykorzystać od 300 do 400 generacji i ostatecznie użyć 15 klipów. Może się to wydawać sporą ilością generacji, jednak patrząc na koszt przy takim rozmachu reklamy, jest to bardzo dobry stosunek. Cała reklama pozwoliła zaoszczędzić jakieś 95% kosztów produkcji. Obejrzymy to sobie.
Odtwarzane wideo odstępne na nagraniu (czas 12:38)
Można powiedzieć, że to spory rozmach. Kolejny model – wracamy do obrazów – to Imagen. Jest on dostępny na Vertexie i jest nieco bardziej zaawansowany niż poprzednie modele Gemini. Oferuje między innymi bardzo dobre przygotowywanie tekstów na grafikach, tak jak w przykładzie tego komiksu. Kiedyś modele AI miały z tym problem, dzisiaj te napisy są bardzo wyraźne i czytelne. Imagen dostępny jest w trzech opcjach: Fast, Ultra oraz Standard. Model ten może się spisać na przykład w branży fashion przy wirtualnym przymierzaniu ubrań – gdy chcemy na jednej postaci przygotować parę rodzajów sukienek czy butów, zawsze będzie to utrzymane spójnie i dopasowane.
Następny model do muzyki to Lyria, która pozwala na generowanie utworów na potrzeby reklamy. Eliminuje to potrzebę przeszukiwania bibliotek utworów – po prostu opisujemy utwór i go generujemy, mając do niego pełne prawa. Posłuchajmy sobie.
Demo utworów stworzonych przez model Lyria posłuchasz na nagraniu webinaru (czas: 15:30)
Możliwości generowania różnego rodzaju utworów jest całkiem sporo. Ostatni model, który przedstawię, to Chirp, który pozwala na generowanie naturalnie brzmiących głosów. Mamy ponad 30 dostępnych głosów w 30 językach. Więcej na ten temat w wersji live demo pokaże Zuzanna. Ja swoją część kończę i przekazuję głos.
Wykorzystanie modeli AI w biznesie
Zuzanna Bychawska: Dobrze. Czy możesz skończyć udostępnianie? Dobra, super. Dziękuję. Ja już udostępniam mój ekran. Dobrze, jeszcze sekundę. Okej, dobrze. To bardzo dziękuję Mariusz. Tak jak on mnie już właśnie przedstawił, nazywam się Zuzanna i jestem customer engineerem. Moja rola to jest pomaganie klientom z takiego technicznego punktu widzenia. Więc jeżeli będziecie zainteresowani i będziecie mieć jakieś pytania dotyczące właśnie technologicznego zastosowania Google Cloud, jak również tej sztucznej inteligencji, my siedzimy akurat w Dublinie. Mój cały zespół jest zawsze chętny do pomocy w tym obszarze.
Dobrze, więc teorie i te techniczne parametry modeli mamy za sobą. Jednak teraz skupmy się na tym, jak w ogóle możemy to wykorzystać w biznesie. Bo często sam model to za mało. I tutaj chciałabym wam pokazać niektóre schematy, takie popularne wykorzystywania. My je nazywamy takie blueprints, czyli takie gotowe przepisy na to, jak połączyć te modele w taki sprawny proces, żeby po prostu drastycznie przyspieszyć produkowanie treści i robić to na naprawdę dużą skalę.
Pierwszym takim przykładem jest tak zwane wzbogacanie katalogu. Tak jak już Mariusz wspomniał wcześniej na temat generowania wideo, tak samo sesje zdjęciowe mogą być drogie i czasochłonne, na przykład w przypadku katalogów, kiedy dana firma ma bardzo dużą bazę produktową. Więc w tym przypadku bierzemy jedno proste zdjęcie produktowe. Tutaj mamy kanapę i wrzucamy je do Imagen.
Dzięki temu i wykorzystaniu takich funkcji jak outpaint i inpaint, czyli możemy coś dodać albo odjąć z danego zdjęcia. W kilka sekund możemy zmienić tło, dodać kontekst, a następnie dzięki modelowi Veo po prostu zrobić image to video, czyli możemy ożywić to statyczne zdjęcie i zrobić z niego krótkie wideo na kartę produktu czy na przykład social media.
Personalizacja relacji na social media
I nawiązując do tych social mediów, zobaczmy to na kolejnym przykładzie. Po prawej stronie mamy zdjęcie torebki, która jest tu naszym inputem, czyli chcemy zrobić kampanię na Instagrama, więc tutaj po lewej stronie w obszarze promptu prosimy ten model o stworzenie trzyczęściowej relacji w stylu street style, powiedzmy tutaj z modelką w Paryżu, tak żeby było bardziej luksusowo.
Zauważcie tutaj co się dzieje. System nie tylko generuje ładny obrazek, on raczej bierze nasz produkt i osadza go w nowym świecie, nie zniekształcając oczywiście tej samej torebki. A ten gotowy materiał po prostu można wrzucić do sieci. Jak widzimy tutaj to jest modelka, ma tą torebkę, ale możemy poczuć też ten vibe Paryża. Mamy rogalik, mamy kawę. Więc możliwości są naprawdę bardzo duże.
Hiperpersonalizacja dostosowana pod klienta
Kolejnym takim aspektem jest hiperpersonalizacja, bo przechodzimy aktualnie od tego modelu jeden asset dla wszystkich, do tysięcy wersji tego samego assetu dopasowanych idealnie pod danego klienta. Aktualnie z jednego szablonu możemy automatycznie wygenerować reklamy różniące się tłem, różnymi detalami. Wszystko w zależności od tego, czy wyświetlamy je na przykład surferowi na wybrzeżu, czy dyrektorowi w znanym biurowcu. Działa to na zasadzie tworzenia takich variables, czyli pewnego rodzaju zmiennych.
Możemy dodać kilka tych zmiennych, że jedna na przykład plaża, drugie biuro, trzecie las i po prostu generować te obrazki w zależności od tych wymagań. I teraz może się pewnie zastanawiacie, okej, dobra, zmiana otoczenia, zmiana detali, ale co z językiem? Dobra wiadomość to jest również dostępne w języku polskim, co najważniejsze, więc możemy również o tym myśleć w tym kontekście. Więc jak widzimy, mamy jeden plakat po angielsku, a następnie możemy poprosić modele sztucznej inteligencji o stworzenie tego samego plakatu, ale z napisem w języku japońskim, w języku rosyjskim czy na przykład po niemiecku.
Zamiana rysunków na wizualizację 3D
Kolejne zastosowanie, to bardzo lubię w ogóle tą opcję, bo to jest taka opcja dla projektantów, która nazywa się właśnie sketch to render. Jest to narzędzie, które zamienia rysunki powiedzmy na serwetce albo proste szkice techniczne, czy to na kartce, czy to na przykład przy wykorzystaniu AutoCAD na wizualizację 3D, co jest oczywiście bardzo efektywne z punktu widzenia czasu.
Nie musimy czekać na przygotowanie tej wizualizacji. Mamy to w kilka minut, więc de facto możemy błyskawicznie sprawdzić, czy nasz pomysł w ogóle ma sens i równie szybko poprawić ten projekt, wprowadzić jakieś zmiany i wygenerować podobną grafikę. Więc jest to ogólnie perfekcyjne rozwiązanie, kiedy robimy jakieś prototypy i po prostu chcemy poeksperymentować trochę na przykład z wyglądem albo z rodzajem naszego logo.
Utrzymanie spójności postaci we wideo
Tutaj mamy bardzo fajny proces, który skupia się na połączeniu różnych modeli. Jeszcze do niedawna jedną z takich największych bolączek związanych z takim praktycznym biznesowym wykorzystywaniem sztucznej inteligencji była spójność. Kiedyś było po prostu tak, że generujesz jedną grafikę, a na tej drugiej ta sama osoba wyglądała inaczej. Aktualnie jest możliwe, że generujemy daną osobę. Tutaj w przypadku Imagen mamy modelkę o takiej hiszpańskiej urodzie z kręconymi włosami.
Następnie możemy wybrać dany ubiór, bo tutaj jest kolejna taka opcja, nazywa się to virtual try-on, w której możemy de facto przymierzyć dane ubrania na danej modelce. Następnie możemy przedstawić tą modelkę w tym wybranym ubraniu, zachowując tą samą twarz, ten sam styl i te same ubrania w różnych lokalizacjach. Dzięki czemu z pojedynczych klatek następnie możemy złożyć płynne takie spójne wideo promocyjne, które wygląda jak profesjonalna produkcja filmowa.
Funkcję tę w praktyce zobaczysz na nagraniu z webinaru (czas: 25:00)
Kompletny wideo storytelling od scenariusza
I na koniec tego segmentu tutaj mamy taki najbardziej zaawansowany proces, czyli pełny wideo storytelling. Prawda jest taka, że aktualnie taki proces stworzenia danego konceptu, stworzenia naszej reklamy, nie jest taki prosty. Musimy mieć pomysł. A tutaj jest przedstawiony taki proces, gdzie możemy wykorzystać sztuczną inteligencję od samego początku, od stworzenia scenariusza. Nawet aktualnie przy wykorzystaniu niektórych narzędzi możemy zrobić burzę mózgów, możemy zostać zainspirowani przez Gemini, który podpowie nam w jaki sposób możemy wykonać na przykład dany klip i stworzyć po prostu na sam koniec dany scenariusz.
Następnie przy pomocy Imagen albo Nano Banana możemy stworzyć storyboard, a następnie dzięki wykorzystaniu Veo zmienić te obrazy w wideo. Łącząc je możemy dodać również jakieś efekty, muzykę. Na sam koniec dostajemy video output, czyli taką gotową historię. I tutaj mamy różne możliwości tworzenia tego procesu. Możemy to zautomatyzować.
Oczywiście będzie wymagać to trochę więcej pracy, możliwe, że zaangażowania osób bardziej technicznych. Możemy użyć agenta, czyli stworzyć po prostu pewnego rodzaju czat, który poprowadzi nas krok po kroku przez ten proces, ale również możemy zrobić wszystko ręcznie, co jest ogromnie wygodne, bo próg wejścia do tego systemu jest bardzo łatwy. Bowiem każda osoba, która nawet nie jest mocno techniczna, może się tym zająć.
Ważne zasady tworzenia dobrych promptów
I teraz chciałabym się skupić na danych elementach, które są bardzo istotne, bo w teorii wszystko wydaje się proste. Jednak w rzeczywistości może być w niektórych momentach problematyczne. Dlatego de facto musimy nauczyć się jak rozmawiać z tymi modelami. Tutaj na przykładzie Veo, czyli naszego modelu do generowania wideo, chciałabym pokazać kilka takich głównych zasad, które są niezwykle istotne, jeżeli chcemy być naprawdę bardzo efektywni w generowaniu tego kontentu. Więc zacznijmy tutaj od sześciu takich najważniejszych aspektów.
Oczywiście na naszej oficjalnej stronie w dokumentacji możecie znaleźć wiele różnych artykułów, blog postów, jak również raportów, które dają takie wskazówki, najlepsze praktyki w jaki sposób formułować te prompty. A co więcej, aktualnie w przypadku Vertex AI, który pokażę chwilę później, istnieje możliwość przeparafrazowania promptu praktycznie automatycznie, dzięki czemu sztuczna inteligencja jeszcze bardziej nam pomaga od samego stworzenia promptu, przeparafrazowania, a następnie do generowania tego kontentu.
Kontekst wideo
Zacznijmy od tego, że pierwszą najważniejszą rzeczą jest ten obiekt. Czyli kto, co będzie miało miejsce, po prostu kontekst tego naszego wideo. I w tym przypadku musimy pamiętać o tym, żeby unikać takich generalnych słów typu ludzie, obiekty, zwierzęta i tak dalej. Dzięki czemu możemy osiągnąć po prostu lepsze wyniki, jeżeli uszczegółowimy po prostu opis tego obiektu.
Przykład tego punktu obejrzysz na nagraniu z webinaru (czas 29:15)
Tutaj mam dwa takie przykłady. Po lewej stronie mamy użyte po prostu słowo a person. W tym przypadku model sam z siebie wybiera daną osobę, wybiera jej zachowanie i tak dalej. Następnie, jeżeli podamy trochę więcej szczegółów, mamy po prostu wideo, które bardziej odpowiada naszym wymaganiom.
Akcja sceny i ruch kamery
Drugą bardzo ważną rzeczą jest oczywiście akcja. Musimy pobudzić ten nasz obiekt do życia. Czyli w tym momencie musimy opisać ruchy, interakcje, ekspresje na twarzy i wiele innych nawet takich subtelnych akcji, na przykład, że jest zimno, co w ogóle pokażę później i para po prostu wydobywa się z ust, bo jest minus 20 stopni. Co też jest oczywiście możliwe. I tutaj znowu takie porównanie. Po lewej stronie po prostu mamy ptak, który sobie fruwa. Jednak po prawej stronie mamy uściślenie tego, że jest to sokół po prostu, że ma taki kolor, że lata nad pustynią. Zobaczmy jak to wygląda.
Powyższy przykład obejrzysz na nagraniu z webinaru (czas: 30:10)
Scena i kontekst
Jak już mamy ten obiekt, jak już mamy ten ruch, skupmy się teraz na scenie i kontekście. Czyli możemy też opisać w jaki sposób widzimy środowisko, w którym dany obiekt się znajduje, lokalizację, czas trwania, czy na przykład chcemy wygenerować daną postać w średniowieczu, a może w roku 2225. Wszystko jest możliwe, jednak oczywiście musimy dodać po prostu te szczegóły. I tutaj mamy pierwsze wideo. Nie wygląda to bardzo zachęcająco. Jednak z drugiej strony, jeżeli dodamy kilka informacji o stylu, o na przykład wypełnieniu słońcem, czyli o rzucie światła i ogólnie o jakichś szczegółach, zobaczmy, że efekt jest o wiele lepszy.
Powyższy przykład obejrzysz na nagraniu z webinaru (czas: 31:18)
Perspektywa i kąt kamery
Następnie patrząc z punktu widzenia wideo, kiedy byśmy robili to na sposób po prostu całkowicie manualny, musimy również pamiętać o kącie kamery, w jaki sposób ustawić to, jaki efekt chcemy osiągnąć. Więc również też mamy możliwość sprecyzowania, czy chcemy na przykład rzut z lotu ptaka, czy może chcemy z dołu, albo może takie ekstremalne zbliżenie. I tutaj mam też takie dwa przykłady. Pierwszy, czyli takie zbliżenie i wyblurowanie tła. Z drugiej strony mamy tutaj rzut z lotu ptaka.
Powyższy przykład obejrzysz na nagraniu z webinaru (czas: 32:15)
Ruch kamery
Kolejną rzeczą jest ten ruch kamery. Bo tutaj też chodzi o to, czy chcemy zrobić ruch zoomowania, albo może oddalania, albo ruch, jakby wyglądało to, jakbyśmy latali na przykład dronem. Wszystko jest możliwe, jednak wymaga to po prostu sprecyzowania. Tutaj po prostu biegniemy niejako za tym obiektem.
Powyższy przykład obejrzysz na nagraniu z webinaru (czas: 32:50)
Odgłosy i dźwięki w nagraniach
I na sam koniec chodzi tutaj o audio. Ludzie są wzrokowcami, ale nie możemy zapominać o odgłosach, które potrafią naprawdę wprowadzić w taką prawdziwą atmosferę, dzięki czemu odbiór tego wideo będzie jeszcze lepszy. I tutaj mam też kolejne dwa przykłady. Mamy właśnie po lewej stronie ambient noise, czyli po prostu odgłosy w danym mieście, ale możemy również skupić się na dialogach i po prawej stronie zrobić w taki sposób.
Powyższy przykład obejrzysz na nagraniu z webinaru (czas: 33:25)
Narzędzie biznesowe Gemini Enterprise
Zanim przejdę do takiego praktycznego dema, chciałam jeszcze wspomnieć na temat tego, gdzie możecie generować ten kontent. Bowiem generowanie kontentu dostępne jest na wiele różnych sposobów, czyli możemy wykorzystać API, możemy wykorzystać takie strony, narzędzia, które pozwalają nam na pewnego rodzaju prototypowanie, albo możemy uzyskać podobny efekt przy wykorzystaniu Vertex AI, który jest już takim porządnym narzędziem produkcyjnym. Najnowszym z tych możliwości jest Gemini Enterprise, o którym mówi się coraz więcej.
Jest to takie narzędzie, które pozwala na wykorzystanie całej mocy Google AI nie tylko do pojedynczych zadań, ale do wszystkich procesów i po prostu do pracy bez względu na to, kim jest dany pracownik, bez względu na to, czym się zajmujesz i co potrzebujesz zrobić. Czyli możemy tutaj budować kontent w oparciu o dane zawarte w innych serwisach. Czyli na przykład dostaliśmy maila od naszego klienta z informacją, co chce mieć na danej grafice, a my przy pomocy po prostu czatu w Gemini Enterprise możemy wygenerować ten obraz bez konieczności kopiowania tych wymagań, wrzucania na nowo. Jedynie napisanie po prostu wygeneruj mi obrazek bazując na wytycznych z maila od Jana Kowalskiego.
Możemy tutaj też automatyzować różne procesy, na przykład wysyłać maile z poziomu Gemini Enterprise, budować agenty i tak dalej. Aktualnie mamy wiele konektorów do przeróżnego rodzaju źródeł, czyli nie tylko jest to Google Cloud jak Kalendarz, Dysk czy chociażby Gmail. Jednak tutaj już są też rozwiązania Salesforce, Outlook czy na przykład SharePoint, dzięki czemu ogólnie ta praca jest jeszcze bardziej efektywna, bo możemy wygenerować kontent, możemy automatyzować procesy, a wszystko jest możliwe dzięki jednemu rozwiązaniu.
Praktyczne środowisko Vertex AI Studio
Demo obejrzysz na nagraniu z webinaru (czas: 36:10)
Dobrze, więc teraz zaraz udostępnię mój ekran i pokażę jak to może działać w praktyce. Dobrze, więc to jest moje środowisko demowe, czyli po prostu konsola Google Cloud i Vertex AI. Mamy tutaj bardzo wiele różnego rodzaju rozwiązań. Jednak dzisiaj skupię się na generowaniu Gen AI, czyli Vertex AI Studio. Jest to właśnie ta usługa, gdzie możemy wykorzystać wiele różnego rodzaju modeli, które zostały wspomniane wcześniej, czyli Veo, Imagen, Nano Banana Pro i tak dalej.
Chciałabym teraz pokazać kilka możliwości. Po pierwsze bardzo fajnym rozwiązaniem jest tak zwany prompt gallery, w którym możemy znaleźć już kilka przykładów, żeby na szybko w ogóle zrozumieć ideę danego modelu. Na przykład właśnie kompozycje z obrazków. Tak jak było wspomniane, że możemy wykorzystać nawet 14 obrazków do tej kompozycji. Jednak na potrzeby dzisiejszej prezentacji chciałabym pokazać bardziej ciekawe rozwiązanie.
Po prawej stronie najpierw możemy sobie wybrać jaki model chcemy użyć. W tym przypadku mamy Nano Banana Pro. I kolejny pewnie może być takie pytanie – tak możemy wprowadzać prompt w języku polskim. Przygotowałam sobie trzy zdjęcia, które zaraz dodam. Mamy kilka możliwości uploadu tych zdjęć, czy to nawet przy pomocy linka URL. Możemy to wrzucić na nasz dysk albo możemy po prostu wrzucić to z poziomu naszego komputera, co właśnie ja zrobię. Okej, coś chyba zróbmy jeszcze raz.
Okej, dobrze. Wróćmy może w takim razie do mojej poprzedniej możliwości i pokażę teraz jak to może wyglądać. Tutaj po prawej stronie mamy kilka po prostu takich przykładów, czyli przykładowych promptów, które możemy wygenerować. Możemy też wybrać różne aktywności, czyli możemy coś dodać, możemy coś usunąć, możemy coś po prostu zmienić, a nawet możemy coś po prostu edytować. W tym przypadku mamy kilka różnych możliwości. Mam nadzieję, że teraz to zadziała.
Bardzo przepraszam, nie mam pojęcia co się dzieje. W takim razie użyjmy tego przykładowego promptu. Zawsze tak jest, że jak się robi demo coś nie działa. Dobrze, klikniemy to. Więc możemy tutaj zauważyć, że mamy kilka obrazków, na którym właśnie mamy kobietę, mamy daną walizkę, która może być naszym produktem, mamy dane siedzenie, mamy mężczyznę i tak dalej.
Teraz następuje po prostu analiza tych obrazków, które dostarczyliśmy i możemy tutaj dodać też prompt. Czyli w tym przypadku mamy wygeneruj obrazek kobiety stojącej w salonie i tak dalej. Możliwe jest to zrobienie również w języku polskim. I teraz jeszcze jedna ważna rzecz. Po prawej stronie jest takie po prostu miejsce do wprowadzenia instrukcji dla systemu. Tutaj możemy napisać na przykład, że jestem specjalistą do spraw marketingu, który zajmuje się tworzeniem kontentu na social media, dzięki czemu wygenerowany kontent będzie jeszcze lepiej dostosowany do tego kontekstu.
Jak tutaj widzimy, mamy tą parę, która tutaj siedzi z daną walizką, z danym ubiorem. Mamy tą samą kobietę, mamy tego samego mężczyznę. Jeżeli nie jesteśmy zadowoleni z tego obrazka, oczywiście możemy to zmienić. A co więcej, aktualnie jest też opcja compare, w której możemy wprowadzić instrukcje na przykład tylko po prawej stronie i porównać następnie dwa wyszukiwania, wprowadzając po prostu dwa różne prompty.
Wirtualne przymierzanie i modyfikacje
Następnie warto zwrócić uwagę na przykład na generowanie wideo. Tutaj mamy opcję text to video, ale mamy też możliwość na przykład rozszerzenia tego wideo albo image to video. Czyli po prostu jak mamy dany rysunek, możemy wygenerować dane wideo bazując na tym rysunku. Tutaj mamy opcję na przykład Imagen, który pozwala nam na zrobienie różnego rodzaju po prostu modyfikacji. I tutaj jest też opcja virtual try-on, czyli na samym początku jeżeli dodamy daną postać.
Tutaj akurat mam kobietę, która siedzi w śniegu, powiedzmy. Następnie mamy kurtkę, którą chcemy umieścić na naszej modelce. Tutaj też wybrałam kurtkę stockową. Po prostu to jest przykładowy obrazek, czyli dodajemy daną osobę w danym kontekście, a następnie ubranie, które chcemy założyć na tą osobę. Analogicznie możemy też dodać kwiatka na stół, możemy zmienić na przykład tło i tak dalej. De facto możliwości są nieograniczone, a wszystko zależy od tego, na co pozwoli nam nasza wyobraźnia. Jak widzimy, teraz ta postać po prostu nosi tą nową kurtkę.
Okej, ale co jeżeli chcemy wprowadzić tą kurtkę, tą kobietę w życie, po prostu ożywić to, a nie zostawić jako statyczny obrazek? Tutaj mamy możliwość zrobienia AI actions, czyli po prostu dodania czegoś, usunięcia, eksportowania obrazku albo wygenerowania wideo. Kliknijmy tutaj i mamy właśnie tą opcję image to video. Ja sobie przygotowałam tutaj już taki prompt, który jest bardzo na czasie. Zima, śnieg, minus 20 stopni.
Podaję to właśnie wszystko w języku polskim i następnie mogę sobie ustawić opcję, że chcę wygenerować również jakiś dźwięk. Chcę po prostu tutaj zmienić aspect ratio. Mogę wybrać jaką długość filmiku chcę wygenerować albo w jakiej rozdzielczości. Na sam koniec czy chcemy zapisać dany filmik w danym miejscu i czy wszystkie wygenerowane obrazki mają być podobne do siebie, a może mają się jakoś różnić. Napiszmy tutaj w takim razie dwa. I aktualnie musimy chwilę poczekać.Zazwyczaj w przypadku Veo to jest kilka minut, a ja w międzyczasie chciałabym wrócić i pokazać w jaki sposób można pracować również z głosem.
Podkładanie głosu do nagrania
Wpierw wróćmy tutaj do text to speech, czyli w tym przypadku chcemy po prostu napisać dany tekst. Mam tutaj po prostu napisane dzień dobry. Wygenerujmy razem jakieś audio. Wrzućmy to tutaj.
Możemy wybrać język. Wspierany jest język polski. I kliknijmy tutaj różne parametry, czyli jak szybko nasz po prostu tekst będzie mówiony, jak głośno i tak dalej. To generuje się o wiele szybciej. Możemy tutaj kliknąć.
Głos AI: Dzień dobry. Wygenerujmy razem jakieś audio.
Okej, mamy wygenerowane audio, ale co jeżeli chcemy zrobić to w bardziej radosny sposób? Mamy też Gemini Pro TTS i tutaj możemy też dodać instrukcje dotyczące stylu. Tutaj napiszmy po prostu, że ktoś ma to mówić w sposób radosny.
Głos AI: Dzień dobry. Wygenerujmy razem jakieś audio.
Więc już widzimy styl tego mówienia jest całkowicie inny. Filmiki się jeszcze, o, wygenerowały się, więc zobaczmy jak to wygląda. Jak widzimy, też w tym prompcie dodałam, żeby ta kurtka się zmieniła, co jest oczywiście też możliwe tutaj. I tutaj ta melodia jest inna, ruch jest inny. Po prostu koncepcja tego filmiku jest trochę inna.
Generowanie muzyki na poczekaniu
Nie mamy dużo czasu, więc ostatnią taką rzeczą będzie wygenerowanie danej muzyki. Tutaj wygląda to bardzo podobnie jak w poprzednim przypadku. Stworzyłam również tutaj prompt, który jest takim opisem tej melodii, którą chcemy wygenerować. Następnie po wygenerowaniu tej melodii możemy ją nałożyć na nasz filmik. Możemy od razu wygenerować filmik tak jak ja zrobiłam tutaj z tą melodią. Wszystko jest ze sobą połączone i de facto wszystko zależy od waszej kreatywności. Więc poczekajmy tutaj chwilę.
Tak jak ostatnio też wspominałam, w przypadku Veo możemy ustawić różne parametry, możemy wykluczyć niektóre aspekty i popracować też nad zróżnicowaniem tej melodii.
(Muzyka)
Oczywiście w tym przypadku możliwe jest również dodawanie dźwięku, dodawanie dialogu i modyfikacja tego w taki sposób, żeby to po prostu odpowiadało naszym wymaganiom. Dobrze? W takim razie bardzo dziękuję za uwagę. Nie ukrywajmy, mogłabym pokazywać i pokazywać, bo to narzędzie jest naprawdę bardzo mocne i jesteśmy w sumie ograniczeni jedynie własną wyobraźnią.
Sesja Q&A
Mariusz Wilczek: Dobrze, dziękuję Zuza za przedstawienie tych modeli w praktyce. Przejdziemy sobie teraz do tej naszej sesji Q&A. Widziałem, że już jakieś pytania się pojawiły, więc tak.
P: Czy obróbka, która dzieje się w oknie Gemini czy też AI Studio?
Tutaj też trochę Zuza pokazała jak wykonywać te obróbki, ale myślę, że możemy sobie to podsumować, gdzie te wszystkie edycje obróbki możemy dokonać.
Zuzanna Bychawska: W przypadku tej obróbki robimy to w tym przypadku w AI Studio, ale wydaje mi się, że część z was mogła już eksperymentować w przypadku po prostu chata Gemini, gdzie po prostu dodajemy nową wartość promptu, czyli na przykład zmień mi fryzurę na tym zdjęciu i też jest możliwa ta obróbka w takim przypadku. Jednak oczywiście możliwości są o wiele bardziej zaawansowane w przypadku Vertex AI Studio albo Google AI Studio, bo to są po prostu rozwiązania dedykowane generowaniu bardziej profesjonalnemu, jakbym to ujęła.
P: Jak długie mogą być ujęcia Veo?
Zuzanna Bychawska: Ogólnie to jest tak, na sam początek możemy wybrać sobie po prostu długość filmiku od około 4 sekund do 8, ale istnieje możliwość również łączenia tych filmików jak również tak zwanego rozszerzenia, czyli możemy dodać kolejne zdjęcia albo kolejny rodzaj stylu typu zastosuj się do tego samego kontekstu do tego samego stylu, dzięki czemu to nasze wideo może być wydłużone do około 30 sekund.
P: Czy w przypadku korzystania z AI w chmurze jest możliwość przed wykonaniem tej edycji na bazie wprowadzonego promptu i materiałów pozyskania informacji ile operacja pochłonie tokenów lub jaka kwota się z tym wiąże?
Zuzanna Bychawska: Ogólnie powiem tak, jest czasami taka możliwość, wiem, że jest planowane rozwiązanie typowo pod wbudowane Vertex, żeby pokazać mniej więcej ile rozwiązanie wygeneruje kosztów, pochłonie tokenów. Jednak jest również możliwość takiego trochę manualnego wyliczenia, bo mamy po prostu szczegółową dokumentację dostępną na stronie, dzięki czemu możemy po prostu tak na oko przeliczyć ile nam to zabierze zasobów. Jednak musimy też o tym pamiętać, że niejednokrotnie jak tworzymy dany prompt to musimy wprowadzać wiele poprawek, bo zazwyczaj pierwsze generowanie nie jest idealne.
Mariusz Wilczek: Tak samo jak właśnie tutaj był ten przykład przy NBA, że było to kilkaset podejść.
P: Czy to jest dostępne tylko w pakiecie Ultra?
Zuzanna Bychawska: To co ja aktualnie pokazywałam to jest wersja w Google Cloud. Są niektóre możliwości generowania w przypadku czatu Gemini, które są dostępne w tym pakiecie Ultra. Jednak ja pokazywałam już takie bardziej zaawansowane narzędzie, czyli on nie jest dostępne w przypadku Ultra. Niestety.
P: Pokażecie jeszcze raz jak wejść w konsolę Cloud?
Zuzanna Bychawska: Dobra, już pokazuję. Czy możesz zakończyć udostępnianie? Super. Bardzo dziękuję. Ogólnie nazewnictwo rozwiązań sztucznej inteligencji w Google Cloud nie jest najlepsze. Nie oszukujmy się, niejednokrotnie te nazwy są bardzo do siebie podobne. Więc w tym przypadku mamy Vertex AI Studio, w które wchodzimy z konsoli. To jest po prostu konsola Google Cloud. Możemy tutaj wpisać Vertex AI Studio i tutaj nam po prostu pojawia to się w taki sposób. Czy o to ci chodziło mniej więcej?
Dalsza część pytania: Tak, ale u mnie wygląda to inaczej.
Zuzanna Bychawska: Okej, dobrze, bo jeszcze jest możliwość generowania niektórych obrazków. To jest narzędzie troszkę mniej zaawansowane. Nazywa się Google AI Studio, a nie Vertex AI Studio. Nie wiem, czy akurat z tego środowiska mam dostęp, ale zobaczmy. I tutaj jest taka opcja, to się nazywa playground, na której możemy też używać z niektórych modeli, generowania niektórych promptów i tak dalej. O, na przykład ja tutaj dwa miesiące temu próbowałam wygenerować spaniela w sukience, więc to wygląda stosunkowo podobnie. Jednak nie mamy aż tylu zaawansowanych modeli i zaawansowanych możliwości personalizacji.
P: Czy AI Studio też jest płatnym narzędziem?
Zuzanna Bychawska: Ogólnie AI Studio, odpowiedź jest taka, to zależy. Jest darmowa wersja, która jest niestety okrojona, nie ma dostępu do tych najnowszych modeli, a ilość wygenerowanych obrazków czy wideo na dzień jest również ograniczona, bo to jest raczej takie rozwiązanie na sam początek, żebyście zobaczyli jak to działa. Istnieje również możliwość podpięcia billinguu pod dane konto Google AI Studio. Wtedy uzyskujemy troszkę większą ilość do generowania tego kontentu.
Jednak tak jak już wspominałam, nie będzie to zasada pay as you go, czyli będą jakieś ograniczenia dotyczące na przykład ilości kontentu niektórych modeli. Więc de facto dla możliwości takich stricte produkcyjnych, dla takiego zaawansowanego używania tych modeli, Vertex AI Studio jest najlepsze, chociaż wersja Google AI Studio też może być satysfakcjonująca dla niektórych użytkowników. To po prostu zależy od tego, czego oczekujecie i jak dużo zasobów, jak dużej ilości wygenerowanego kontentu potrzebujecie.
Podsumowanie działań eksperckich FOTC
Mariusz Wilczek: Dobrze, dziękujemy Zuza, jeżeli możesz, o właśnie ja jeszcze udostępnię na chwilkę. Będziemy się już zbliżać do końca, ponieważ jesteśmy już po czasie. Także jeszcze raz Zuza, bardzo ci dziękuję za pokazanie tego tej strony praktycznej. Dziękuję też tutaj za czas naszych uczestników. Wspomnę jeszcze, że my jako FOTC oczywiście też tutaj wspieramy klientów, jeżeli chodzi o wsparcie w zakresie doboru technologii. Oferujemy konsultacje, bezpieczną konfigurację, onboarding na Vertex.
Jeżeli się jakieś jeszcze pytania pojawią, czy będziecie zainteresowani wykorzystywaniem tych narzędzi, to zachęcamy do kontaktu tutaj przez nasz e-mail: sales@fotc.com. Cały nasz proces jest też tutaj pokazany. Opieramy się na konsultacji, prowadzeniu projektów pilotażowych, wspieramy we wdrożeniu produkcyjnym i oczywiście po wdrożeniu w całym wsparciu i rozwoju, monitoringu, optymalizacji czy nowych funkcjonalnościach.
Także myślę, że dzisiaj na dzisiaj to wszystko. Dziękuję jeszcze raz wszystkim za obecność. Nagranie też oczywiście wyślemy. Życzę miłego dnia. Zachęcam do zjedzenia pączka w szus.
Zuzanna Bychawska: Tak, dokładnie. Dużej ilości pączków.
Mariusz Wilczek: Tak, im więcej, tym lepiej.
Zuzanna Bychawska: Dokładnie. Dziękuję. Dzięki bardzo.
Mariusz Wilczek: Do zobaczenia, do usłyszenia. Cześć.



