Siema!
Dziś ode mnie dwa artykuły i jeden film na YouTube. Do tego przyglądamy się ostatnim premierom modeli (których było badzoo dużo), w tym następcy mojego ulubionego Groka 4.6 i nowego Opusa 5.5. Czy Anthropic w końcu się odkuł za nieudaną piątkę?
Poza tym sprawdzamy nowości od OpenAI zaprezentowane na długo wyczekiwanym Dev Day oraz Jev. Dlaczego wszyscy zachwycają się tym nowym modelem, któremu daleko do klasycznych LLMów?
Czemu nie lubimy AI?
W IT większość z nas jest przekonana do AI i nawet jeśli mamy jakieś wątpliwości co do jakości rozwiązań, tak nikt już sobie nie zadaje pytania, czy używać AI, czy też nie.
Zupełnie inaczej wygląda rzeczywistość poza naszą technologiczną bańką. Od wielu miesięcy obserwowałem niechęć ludzi do AI, kontrowersje wokół wykorzystania AI w sztuce, zalew slopu, wpływ AI na rynek pracy i przyszłość młodych ludzi. W końcu udało się skleić z tego pełnoprawny materiał:
Staramy się odpowiedzieć na pytanie: gdzie kończy się pomoc AI, a zaczyna zastępowanie ludzkiej pracy. I czy da się korzystać z AI bez utraty własnego myślenia, kreatywności i jakości tego, co tworzymy :)
Premiery modeli i zmiany rozliczeń
Ostatnie tygodnie to totalna przesada, jeśli chodzi o premiery i nowości. Niedawno wszyscy krzyczeli o spowolnieniu rozwoju, ale jakoś na razie tego nie widać. Co prawda nie dostaliśmy kolejnego, rewolucyjnego modelu, ale jest w czym przebierać.
Przez ostatnie tygodnie dostaliśmy m.in.:
GPT-6 Sol i Luna
GPT-6.1 Sol
Grok 4.7
Opus 5.5
Sonnet 5.5
Haiku 5.5
Gemini 4 Argon
Zacznijmy od Groka, 4.6 był moim daily driverem przez dłuższy okres i byłem z niego bardzo zadowolony. Czekałem więc mocno na jego następce, ale trochę się zawiodłem. 4.7 jest spoko modelem, ale wydaje się wolniejszy oraz czuć, że w porównaniu do konkurencji, to jednak niższa liga. Nie czuję tu zbyt dużego przeskoku w porównaniu do poprzednika, Trochę szkoda, ale może 4.8 nas zaskoczy.
W przypadku OpenAI sprawa wygląda dużo bardziej skomplikowanie. Najpierw wypuścili GPT-6 Astra, którego niektórzy okrzyknęli AGI. Chwilę później wyszły GPT-6 Sol oraz Luna. Pomimo tego, że były 50% tańsze od analogicznych modeli w 5.6, nie spotkały się one z jakimś wielkim entuzjazmem.
Następnie OpenAI ogłosiło zmianę sposobu rozliczeń. Z korporacyjnego na nasze jest o połowę drożej. Plan za $200 oferuje teraz tyle co plan za $100. Dodatkowo dostaliśmy plan za $500, który oferuje 25x Pro, czyli nieco więcej niż stary $200 (ten miał 20x Pro). Firma tłumaczy to tym, że nowe modele będą na tyle opłacalne, że wyjdzie to nam jedynie na dobre. Ekhem, ekhem, śmiem wątpić. Potwierdzać to miał zaprezentowany GPT-6.1 Sol, którego pricing jest faktycznie zaskakująco niski, ale duża liczba użytkowników narzeka na szybko znikające limity. Już bardziej nie dało się tego skomplikować…
Na tym całym zamieszaniu wokół OpenAI skorzystał Anthropic, wypuszczając Opusa 5.5 oraz Sonneta 5.5. Ten pierwszy jest naprawdę genialnym modelem, którego używam od premiery. Świetnie radzi sobie w taskach programistycznych, ale też wizualizacjach, tworzeniu animacji czy motion graphics. Jestem pod dużym wrażeniem tego, jak radzi sobie z SVG i rysowaniem rzeczy. Udało mi się postawić z nowym Opusem małe, personalne narzędzie, które jest właśnie oparte na SVG i poradziło sobie świetnie. Wcześniejsze modele miały tutaj ciężary.
Opus zdecydowanie przesuwa mój poziom zaufania do modeli w stronę “ufam, że to ogarnie i będzie to dobrze zrobione”. Często moje podejście skupia się na tym, co chcę zrobić, bez dokładnych szczegółów implementacyjnych. Opus bardzo dobrze rozumie moje intencje i porusza się po mniejszych i większych codebasach. Oczywiście, nie można tutaj mówić o vibe codingu, bo dużo zależy od tego, jak wygląda środowisko, w którym model pracuje, oraz od tego, w jaki sposób podejdziemy do implementacji zadań. Czuję jednak realną różnicę w tym, jak podchodziłem do pracy z poprzednimi generacjami modeli.
Cenowo, przynajmniej w subskrypcji, wygląda to ekstra. W przeciwieństwie do OpenAI, można nawet coś poklikać na najtańszym planie i nie zjemy od razu całych limitów. Sonnet też jest okej, ale miałem okazję testować go jedynie w formie wokera, któremu Opus przekazuje zadania. Haiku na pierwszy rzut oka wygląda na realną alternatywę dla modeli Luna od OpenAI. Byłem przekonany, że Anthropic już na dobre ubił linię Haiku, a tu taka niespodzianka :)
A co z Googlem? Długo czekaliśmy na premierę czwórki, ale jeszcze chwilę sobie poczekamy. Google pokazał jedynie benchmarki i możliwości. Do użytku będzie oddany niedługo. Na papierze wygląda spoko, ale zobaczymy, jak będzie w rzeczywistości. Z Googlem nigdy nie wiadomo, a od dłuższego czasu marnie wyglądają ich najlepsze modele.
OpenAI Dev Day i personalni agenci
Przez ostatnie tygodnie mocno hypowany był OpenAI Dev Day, na którym twórcy ChatGPT mieli zaprezentować masę świetnych nowości. Jak wyszło?
Przede wszystkim dostaliśmy Dots, czyli odpowiedź OpenAI na personalnych agentów, takich jak Grok Bot czy Muse od Mety. Powstał do tego nowy branding i czuć było, że Dots będą jednym z głównych priorytetów przez następne miesiące. Wygląda to całkiem spoko, szczególnie z perspektywy kogoś, kto jest mocno w ekosystemie ChatGPT. Dots skorzystają z Twojej istniejącej konfiguracji, będą też miały dostęp do informacji o Tobie. Niestety, są niedostępne w UE i oferowane jedynie w planie za $100. Nie ma za to, przynajmniej na razie, osobnego limitu na korzystanie z Dotsów.
Pokazano również ChatGPT Space, czyli platformę do kolaboracji, coś podobnego do Notion. Platforma będzie integrowała się z czatem i Dotsami. Do tego dostaliśmy Decisions API, czyli odpowiedź do Jev’a (o którym więcej niżej).
Oprócz kilku pomniejszych produktowych nowości, dużym punktem był wcześniej wspomniany GPT-6.1 Sol, nowy plan $500 oraz tryb Ultrafast, który jest aż do 8 razy szybszy.
Osobiście trochę się zawiodłem. Duże zamieszanie wprowadziły zmiany pricingu, które, pomimo zapewnień OpenAI, wydają się negatywnie wpływać na to, ile faktycznie mamy tokenów do wykorzystania. Do tego ilość premier, w tak krótkim czasie, powoduje totalne zamieszanie.
Jev: nowy, tani sposób na AI
Pośród tych wszystkich premier od dużych AI labów pojawiło się coś naprawdę świeżego, czego nikt się nie spodziewał. Firma TypeSafe AI zaprezentowała model Jev, który mocno poruszył bańkę AI. O co w tym chodzi?
Jev to nie LLM, to nie klasyczny czatbot. Nie generuje tekstu. To model, który zwraca ustrukturyzowaną decyzję z prawdopodobieństwami i confidence score. Działa jak taki mądry if statement. Jest bardzo szybki (kilkaset milisekund) i bardzo tani (grosze za miliony wywołań).
Działa w trzech trybach
null: tak/nie z wynikiem 0-1
choice: wybór jednej opcji z listy
score: ocena na zdefiniowanej skali
Gdzie takie coś może się nam przydać w praktyce? Kilka fajnych case’ów:
Oczywiście, nie zastąpi nam to w większości przypadków, w których używamy LLMów. ALE, jest to zdecydowanie coś bardzo ciekawego. Szczególnie jeśli weźmiemy pod uwagę szybkość i cenę. Ciężko jest z Jevem nabić rachunek w postaci kilku czy kilkunastu dolarów, a w niektórych przypadkach genialnie się sprawdzi.
Po dużym sukcesie Jeva OpenAI zaprezentowało swoje Decisions API, ale jak widać w benchmarku poświęconym tego typu modelom, jest na razie daleko w tyle.
Ciekawe linki
Your reasoning effort level is too high
Ustawiasz “effort” na maksa? Prawdopodobnie popełniasz błąd. Ustawienie go na najwyższą wartość da nam najlepsze rezultaty, ale wiąże się z konsekwencjami. O tym, jak go wybrać, o tradeoffach i na co zwracać uwagę, piszę w nowym artykule!
Don’t make the agent remember how to do its job
Bierzemy pod lupę dwa świetne narzędzia. Pi to harness, który możemy dostosować do swoich potrzeb. Kody to asystent, który łączy się z Twoim agentem i tworzy integracje, które żyją nawet wtedy, kiedy zamkniesz laptopa. Dzięki nim jesteśmy w stanie przekształcić zadanie agenta w w pełni deterministyczną zdolność, która nie tylko zapewni nam większą pewność rozwiązania, ale również oszczędzi nam sporo tokenów.
Już uciekasz?
Jeśli Ci się podobało, kliknij 🧡 poniżej, to nic nie kosztuje! Doceniasz w ten sposób moją pracę i motywujesz do dalszych działań:)
Do następnego,
Olaf





