Witajcie kochani w kolejnym nagraniu z Mojej Szuflady - Piotr Witek się kłania. W dzisiejszym odcinku zapraszam Was na kolejną odsłonę aplikacji VOCR, a dokładnie rozpoznawanie obrazów z wykorzystaniem sztucznej inteligencji za pomocą aplikacji VOCR. Jak tego dokonać? Dowiecie się z linków, które podpinam tutaj do opisu tego nagrania. Znajdziecie je także w mojej szufladzie. Tam wyczerpujące informacje na temat tego, jak skonfigurować aplikację VOCR, gdzie musicie pozyskać niezbędny klucz API i tak dalej. Tutaj pokażę Wam tylko efekty ostateczne działania tego rozpoznawania obrazu. Różnego rodzaju aplikacje do rozpoznawania obrazów dla osób niewidomych i słabowidzących już funkcjonują. Są to aplikacje na urządzenia mobilne, mamy na Windowsa aplikację Be My Eyes. W momencie, gdy nagrywam ten materiał, nie ma jeszcze Be My Eyes na komputery z systemem macOS, dlatego korzystamy z aplikacji VOCR w wersji 2 i wyżej. Nadal jest to wersja beta, więc przypominam, że nie do końca może to być stabilne rozwiązanie. Często zwracamy, mamy informacje o błędzie, zresztą sami zobaczycie. Przypominam, bo przejdę od razu tutaj do demonstracji, jak wywołujemy zeskanowanie ekranu CTRL-CMD-SHIFT-W. Mam informację, że nic nie znaleziono. Więc teraz, skoro nic nie znaleziono, to sprawdźmy, czy tutaj znajdzie coś. Nowa funkcja rozpoznawania obrazu w aplikacji VOCR. W tym celu naciskam skrót CTRL-CMD-SHIFT i klawisz A, jak Artificial Intelligence. Słyszymy, że informacja została... To jest już opis. Jesteście zdziwieni? Zatrzymuję w tym momencie. To, co usłyszeliście, jest opisem okna Zoom. Bo to, co dzisiaj dla Was nagrywam, widok ekranu, to co widać na komputerze, czyli okno mojej szuflady, widzicie w oknie udostępnianym Zooma, bo nagrywam Wam w Zoomie. Dlatego obraz, który został zeskanowany w tym momencie, to jest zwrót ekranu, który wykonała aplikacja VOCR, wysłała go do OpenAI, do chatbota GPT w wersji 4.0, który rozpoznał ten zrzut ekranu i po jego analizie przesłał mi zwrotną informację. Ta informacja trafiła do schowka, więc gdybym chciał, w tym momencie mogę sobie wkleić cały ten tekst do jakiegoś edytora tekstu i zrobić z niego użytek. Może ktoś powiedzieć, ale jak to? Przecież chciałbym na przykład dopytać o jakieś szczegóły, bo mamy taką możliwość w aplikacji Be My Eyes i czy to jest możliwe tutaj? Tak, jest możliwe, bo ja to specjalnie wyłączyłem w tym momencie, a włączamy to bardzo prosto. Ja w tym momencie wywołam menu, status menu, czyli voice over dwa razy klawisz M. Mam tutaj ikonkę VOCR, wy teraz możecie tego nie widzieć, ale ja to rozwijam, słyszycie, mam ustawienia, ustawienia rozwijam i mam tutaj coś takiego jak use last prompt, użyj ostatniego promptu. Ona, nie jest tutaj ta informacja anonsowana, że to pole jest zaznaczone, ale ja tu kliknę Enter i zobaczymy co się stanie. Jestem na mojej stronie internetowej, w przeglądarce Safari i teraz znowu nacisnę skrót. Najpierw może zatrzymam jeszcze raz, Ctrl, Cmd, Shift, W. Znowu mam informację, że niczego nie znaleziono. Ja się może przełączę jeszcze, dla pewności, tak, jesteśmy w Safari. Jeszcze raz, Cmd, Ctrl, Shift, W. Nic nie znaleziono, ale ja znowu naciskam teraz ten sam skrót, Cmd, Ctrl, Cmd, Shift, A. No i poleciało nam zapytanie do sztucznej inteligencji zamiast pojawić się pytanie, więc jeszcze raz. Słyszycie, mamy błąd dostarczenia informacji, to nawet dobrze. Ja jeszcze raz, teraz niby zaznaczone, odznaczam i zobaczmy to. Jeszcze raz, nic nie znaleziono. O, i teraz gdy nacisnąłem Ctrl, Cmd, Shift, A, wyskoczyło mi okienko na prompt. Mam tutaj wpisane po angielsku, aby narzędzie, ChartGPT przeanalizowało obraz i wysłało mi szczegóły tego obrazu, ale zwróćcie uwagę, komunikat jest po angielsku, więc odpowiedź też dostałbym po angielsku. Jeśli nie chcemy, aby odpowiedź była po angielsku, to w tym miejscu powinniśmy sobie wpisać Translate Answer, czyli Answer in Polish. Przetłumacz odpowiedź na polski. I teraz daję OK, wyślij i mam znowu analizę ekranu, co znajduje się w tym momencie na ekranie. Klasyczna rzecz, znacie to z innych aplikacji. Ja po to, aby nie musieć ponownie tego promptu wpisywać i nie wpisywać, żeby tłumaczona była odpowiedź na język polski, to od razu sobie tutaj kliknę Use Last Prompt, użyję ostatniego promptu i sprawdźmy, czy to zadziała. Control, Command, Shift, A. Nie, jesteśmy pychtani znowu. Tylko zobaczmy, czy jest. No i nawet nie mamy wpisane, żeby była przetłumaczona na polski. To trzeba kilkukrotnie sprawdzić, aż będziemy mieli pewność, że ta opcja została zaznaczona, głównie po to, żeby nie wpisywać za każdym razem, aby odpowiedź była tłumaczona na polski. Na szczęście mamy też tutaj w aplikacji VOCR główny prompt, gdzie możemy sobie na stałe wpisać, żeby informacje, które będziemy otrzymywać zwrotnie były tłumaczone na polski i wtedy te informacje możemy wykorzystywać także do innych celów. Do jakich? O tym za sekundkę. Pierwsza rzecz, już Wam ją zademonstrowałem, bo chcę pokazać trzy. Pierwsza, czyli rozpoznawanie całego ekranu, to co widzimy. Jest robiony screen, wysyłany jest do sztucznej inteligencji. Druga rzecz, to tak zwana eksploracja ekranu. Coś, co już jest w aplikacji VOCR. Demonstrowałem Wam to w nagraniu demonstrującym zaczytywanie, czy instalowanie aplikacji mobilnych na komputerach macOS. Tutaj jest to nieco bardziej rozszerzona funkcjonalność. Ja, żeby ją wywołać, naciskam klasycznie dla tej aplikacji VOCR CTRL-CMD-SHIFT-E, jak eksploracja. I w tym momencie znowu jest robiony zrzut ekranu mojego komputera, wysyłany do OpenAI i tam jest informacja o błędzie, że stracono połączenie z serwerami. To jeszcze raz. Zaraz powinniśmy dostać informację. Na informacje, które znajdują się na ekranie, mam nałożone dodatkowe informacje o elementach, które zostały rozpoznane na ekranie i o ich lokalizacji. Niestety, te informacje są w języku angielskim i nie mamy dostępu do Promptu, aby go przetłumaczyć na polski. Więc na razie tylko Wam mogę pokazać, bo poruszamy się klasycznie. CTRL-CMD i strzałki po tych rozpoznanych elementach na ekranie komputera. I ikona monitora. No i tyle nam tutaj przeczyta, więcej nam nie chce czytać. Ja Wam powiem szczerze, nie korzystam z tej opcji, bo ona działa słabo. I generalnie póki co przynajmniej nie polecam. Warto ją obserwować, jej rozwój, bo jest szansa, że coś z tego wyjdzie. Ale na tym etapie działa to słabo. Więc mamy tutaj pierwszą opcję, która działa całkiem fajnie, czyli rozpoznawanie tego, co jest na ekranie. No Wy nie mogli się przekonać, jak dobrze to działa, bo odczytywane jest całe okno programu, a nie tylko screen. Czyli nie możemy zrobić sobie takiego małego screenu interesującego nas fragmentu, na przykład menu. Tylko robiony jest cały screen. Później możemy korzystać z eksploracji, ale jest jeszcze trzecia opcja. I tutaj rozpoznawany jest klasycznie jeden obraz, czyli możemy sobie zrobić ten wspomniany chwilę temu mały screen, na przykład menu, zapisać go i później go rozpoznać. Jak to działa? Muszę przejść do okna Findera. Mam otwarte w tym momencie okno Findera i kilka zdjęć. I są to zdjęcia z mojej biblioteki, zdjęć, które specjalnie opisałem w taki sposób, żeby mnie samemu niewiele mówiły. Na przykład mam tutaj informację Piotr, Izako, JPG. Nie wiem, co jest na tym zdjęciu poza mną i moim pieskiem. Więc ja teraz otworzę tą grafikę, to zdjęcie w aplikacji VOCR, czyli wchodzę w menu, klik, otwórz w aplikacji, VOCR i daję Enter. I w tym momencie wyskakuje mi prompt, bo jednak jest nie zaznaczony, to od razu dopiszmy tu. Ok. Czekamy na odpowiedź, zobaczymy, czy ona przyjdzie, czy też nie. I w międzyczasie zaraz zaznaczymy sobie też, żeby ten prompt jednak nie trzeba było go za każdym razem wpisywać, bo to jest irytujące. I słyszycie, mamy znowu błąd, więc sprawdźmy, czy on zapamiętuje mi ten ostatni prompt w ogóle, czy dopiero musi się zrealizować, że tak powiem. Robię dokładnie to samo, czyli otwieram fotkę w taki sam sposób. Dobra. Mamy zapisane. Prompt zapisany był w sensie w polu edycyjnym. To nie jest halucynacja. Tu usłyszeliśmy na końcu, oprócz całej informacji, co znajduje się na zdjęciu, że ja i Zach jesteśmy ubrani w takie same koszulki polo, mamy informację na końcu, że ta informacja została przetworzona przez OpenAI, ile kosztowało jej przetworzenie, ile tam tokenów było przetwarzanych oraz zapytanie zostało wysłane przez aplikację VOCR właśnie do czata GPT i to jest odpowiedź. Ja teraz wejdę tylko na szybko jeszcze raz w ustawienia VOCR, use last prompt, oznaczyliśmy i na tej samej zasadzie mamy jeszcze jakąś konferencję, że ja jestem niby na zdjęciu w trakcie tej konferencji, więc sprawdźmy znowu, w jakich okolicznościach ja tam jestem, czy uczestnik, czy jako kto. Znowu klikam otwórz w aplikacji, zdjęcie jest wysyłane do czata GPT, czat GPT analizuje i zaraz powinien wrócić do nas z odpowiedzią albo z informacją o błędzie, że coś poszło nie tak. Mamy nadzieję, że jednak będzie to informacja na temat, a jednak znowu błąd. Za długi czas oczekiwania, no to my w takim razie jeszcze raz. Jest to przyznajcie dość irytujące takie podejście. Musimy czekać, ja korzystam z opcji płatnej, ale to nie są żadne, wiecie, tam… ... ... I tak dalej. Pierwsza rzecz, nie musiałem już wpisywać promptu, bo automatycznie poszła informacja, że ma być tłumaczenie na język polski. Druga rzecz, mamy tutaj pełen opis sytuacyjny, więc ja już dzięki temu mogę łatwo dowiedzieć się, co na zdjęciu się znajduje. Kolejna rzecz, to o czym wspominałem wcześniej, że tak irytujące jest to ciągłe wchodzenie listaw ustawienia, dlatego możemy sobie, przypominam, do tego też podam link w opisie, ustawić sobie w komputerach Mac odpowiedni skrót klawiszowy do tego, aby formatę np. graficzną otwierać w konkretnej aplikacji, czy po prostu dany plik otworzyć w konkretnej aplikacji. Ja też mam taki skrót zrobiony tutaj dla aplikacji VOCR. Też tutaj zakój Piotr w Krakowie, ja sobie utworzyłem po prostu systemowy skrót CTRL-CMD-R. Nie muszę nigdzie wchodzić w żadne ustawienia dodatkowe, menu, szukać, gdzie tam jest otwórz w aplikacji itd. Po prostu jeden skrót klawiszowy i plik wysyłany jest do czata GPT. On rozpoznaje i zwraca mi albo opis na co liczę, albo error. I jak mamy błąd, to znowu nie muszę gdzieś tam popać i grzebać, tylko naciskam sobie skrót ponownie. Informacja jest ponownie wysyłana. Mówiłem wcześniej, że ja tutaj mam płatne API, ale nie właśnie jakieś super wysokopłatne. Stąd pewnie często odbijane informacje o błędach. ... Zwróćcie uwagę, że mamy tutaj opis podzielony na sekcje. To jest bardzo częste. ... Tłumaczenia czasami są lepsze, czasami są gorsze, ale oczywiście bardzo łatwo nam się zorientować, o co chodzi, jeśli chodzi o opis zdjęcia. Czy to tylko możemy wykorzystywać do opisu zdjęć? Nie. Możemy też wykorzystywać to do opisu np. zabezpieczenia kepcia. Czy to na stronie internetowej, wtedy wykorzystujemy ten skrót Ctrl-Cmd-Shift-A i możemy wtedy dopytać, czy doprecyzować, o co nam chodzi. Że chodzi nam właśnie o kod kepcia, żeby automat podał nam to rozwiązanie. Możemy też skorzystać po prostu z ogólnego opisu. Ja tutaj mam takie zabezpieczenia kepcia, które czasem pokazuję na szkoleniach. I zobaczmy, czy poradzi sobie z nim nasze rozwiązanie. Ctrl-Cmd-R. Wysyłana jest grafika do OpenAI. Czekamy na informację zwrotną. Tutaj pewnie zostanie opisana cała grafika, nie tylko kod. Więc też przy okazji dowiemy się, jak skonstruowana jest taka grafika. Oczywiście jeśli tylko wszystko będzie działać. To jest oczywiście minus wersji beta, że nie jest to rozwiązanie dedykowane. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Dedykowana jest grafika. Kłaniam się nisko, Piotr Witek.