Na rynek trafia Claude Opus 5 – model zaprojektowany z myślą o codziennej, efektywnej pracy. Nowa jednostka łączy zaawansowane zdolności rozumowania z wysoką opłacalnością, oferując możliwości zbliżone do modelu Claude Fable 5 przy zachowaniu kosztów na poziomie poprzednika, czyli modelu Opus 4.8.
Opus 5 wyznacza nowe standardy w testach dotyczących programowania oraz pracy koncepcyjnej. W benchmarkach takich jak Frontier-Bench czy GDPval-AA model ten osiąga wyniki przewyższające dotychczasowe rozwiązania. Choć w zadaniach z zakresu cyberbezpieczeństwa ustępuje modelowi Mythos 5, w codziennych zastosowaniach biznesowych i inżynieryjnych staje się nowym domyślnym wyborem dla użytkowników Claude Max oraz najpotężniejszym narzędziem w ramach Claude Pro.
Efektywność w zadaniach inżynieryjnych i badawczych
Kluczowym atutem Opus 5 jest optymalizacja kosztów przy jednoczesnym wzroście wydajności. Użytkownicy mogą dostosowywać poziom zaangażowania modelu, co pozwala na balansowanie między maksymalną inteligencją a szybkością i oszczędnością tokenów.
W obszarze inżynierii oprogramowania wyniki są znaczące:
- W teście Frontier-Bench v0.1 model Opus 5 wyprzedza wszystkie inne jednostki, osiągając ponad dwukrotnie lepsze rezultaty niż Opus 4.8 przy niższym koszcie jednostkowym.
- W CursorBench 3.2, przy maksymalnym ustawieniu wysiłku, Opus 5 osiąga wyniki niemal identyczne (różnica 0,5%) jak Fable 5, kosztując przy tym o połowę mniej.
- W zadaniach typu ARC-AGI 3, wymagających rozwiązywania zupełnie nowych problemów, Opus 5 uzyskuje wynik trzykrotnie wyższy od kolejnego najlepszego modelu.
- W automatyzacji procesów biznesowych (Zapier AutomationBench) model ten wykazuje skuteczność o 50% wyższą niż najbliższa konkurencja.
Model wykazuje również duży postęp w naukach przyrodniczych, w tym w biologii strukturalnej, chemii organicznej oraz bioinformatyce. W zadaniach takich jak wnioskowanie o strukturach molekularnych na podstawie danych spektroskopowych, Opus 5 notuje poprawę o 10,2 punktu procentowego względem wersji 4.8.
Autonomia i precyzja w działaniu
Claude Opus 5 wyróżnia się zdolnością do samodzielnej weryfikacji własnej pracy oraz iteracyjnego poprawiania błędów. W testach wczesnego dostępu model wykazał się dużą sprawczością, potrafiąc m.in. stworzyć własny potok wizji komputerowej do rekonstrukcji części maszyn na podstawie pikseli czy samodzielnie zbudować środowisko testowe do weryfikacji kodu, gdy brakowało zewnętrznych danych walidacyjnych.
Claude Opus 5 zachowuje się bardziej jak ostrożny naukowiec niż jakikolwiek inny model, z którym pracowaliśmy. Sięga po odpowiednie testy statystyczne, aby wykluczyć czynniki zakłócające, krzyżowo sprawdza własne wyniki niezależnymi metodami i utrzymuje koncentrację podczas długich, wieloetapowych analiz. – Alfredo Andere, CEO
Bezpieczeństwo i dostępność
Zgodnie z audytami behawioralnymi, Opus 5 jest obecnie najlepiej dostosowanym modelem w ofercie, wykazującym najniższy wskaźnik zachowań dezinformujących. W kwestiach cyberbezpieczeństwa wprowadzono zrównoważone zabezpieczenia: model pozwala na wykrywanie luk w kodzie źródłowym, ale blokuje skanowanie binarne czy generowanie exploitów.
Ceny modelu pozostają na poziomie poprzedniej generacji: 5 dolarów (ok. 20 zł) za milion tokenów wejściowych oraz 25 dolarów (ok. 100 zł) za milion tokenów wyjściowych. Dostępny jest również tryb Fast, oferujący dwuipółkrotnie szybsze działanie przy dwukrotnie wyższej cenie bazowej. Wraz z premierą wprowadzono funkcję automatycznego przełączania na inny model w przypadku zablokowania zapytania przez filtry bezpieczeństwa, co zapewnia ciągłość pracy w środowiskach API.
