Przejdź do treści

Firma Anthropic przedstawia Claude Opus 5.5 – pierwszy nowy model od wezwania do ustanowienia nowych standardów w AI

2 minuty czytania

Czy nowa propozycja od Anthropic faktycznie okaże się nowym standardem w świecie zbuntowanych agentów AI?

Wesprzyj redakcję i dodaj PC Format do ulubionych źródeł w Google. To dla nas bardzo ważne!

Firma Anthropic przedstawia Claude Opus 5.5 – pierwszy model z naszej nowej rodziny Claude 5.5. Pod względem wydajności w większości zadań dorównuje on modelowi Claude Fable 5.1, a jego eksploatacja ma być o 40% tańsza niż w przypadku modelu Opus 5. W oficjalnej zapowiedzi firma zwraca uwagę, że jest to jej pierwsza nowa premiera od czasu wezwania do ustanowienia nowych standardów w dziedzinie rozwoju sztucznej inteligencji.

Wydajność

Anthropic chwali się, że Opus 5.5 stanowi znaczący krok naprzód w stosunku do Opus 5. Pierwsi testerzy odnotowali znaczny wzrost wydajności przy realizacji najbardziej złożonych zadań. Jeden z testerów zakończył migrację kodu liczącego 680 000 wierszy w mniej niż jeden dzień — zadanie, które jak podaje firma, zespołowi inżynierów zajęłoby tygodnie.

Model świetnie radzi sobie z wykrywaniem i eliminowaniem nieefektywności w oprogramowaniu: kiedy został poproszony o skrócenie czasu ładowania wszystkich stron aplikacji internetowej, Opus 5.5 osiągnął sukces w 39 z 40 przypadków, podczas gdy Opus 5 wprowadził mniejsze poprawki, które jednocześnie zmieniły zachowanie aplikacji. Inny tester zlecił kilku modelom Claude’a stworzenie gry na podstawie pojedynczego polecenia. Opus 5.5 uzyskał wyższy wynik niż jakikolwiek inny model dzięki jakości grafiki i dopracowaniu.

Bezpieczeństwo

Anthropic zwraca również bardzo dużą uwagę na bezpieczeństwo. Opus 5.5 osiąga najlepsze wyniki spośród wszystkich dotychczasowych modeli w zautomatyzowanym audycie behawioralnym – zestawie testów zgodności, który sprawdza działanie Claude’a w tysiącach symulowanych scenariuszy. Jest znacznie mniej skłonny niż inne najnowsze modele do podejmowania działań trudnych do cofnięcia lub wykraczania poza wyznaczone granice, a także wykazuje większą odporność na wstrzykiwanie podpowiedzi niż Opus 5.

Claude Opus 5.5 to nasza pierwsza wersja od czasu, gdy wezwaliśmy do ustanowienia nowych standardów w tej dziedzinie. Przed wydaniem została przetestowana przez zewnętrznych ekspertów, w tym firmy Frontier Design i METR. W naszym zautomatyzowanym audycie behawioralnym – najbardziej kompleksowym teście zgodności, jaki przeprowadzamy – Opus 5.5 okazał się modelem o najlepszych wynikach spośród wszystkich dotychczas testowanych przez nas. Wyposażono go również w zabezpieczenia, które opracowaliśmy dla naszych najbardziej zaawansowanych modeli.

Anthropic

Firma rozszerzyła również zakres swoich testów zgodności, aby objąć nimi dłuższe zadania, zadania niemożliwe do wykonania oraz scenariusze wzorowane na rzeczywistych zdarzeniach, choć nadal istnieją pewne ograniczenia.

Koszta i szybkość

Obsługa Opus 5.5 wymaga mniejszego nakładu obliczeniowego niż Opus 5, co znajduje odzwierciedlenie w jego cenie. Testy firmy Anthropic pokazują, że przy ustawieniach domyślnych koszt obsługi typowych obciążeń będzie o 40% niższy niż w przypadku Opus 5.

Tokeny wejściowe i wyjściowe kosztują odpowiednio 4 i 20 dolarów za milion, czyli o 20% mniej niż w przypadku Opus 5. Odczyty z pamięci podręcznej (które stanowią większość kosztów związanych z działaniem agentów i kodowaniem) kosztują 0,20 dolara za milion tokenów, czyli o 60% mniej niż w przypadku Opus 5. Opus 5.5 generuje również wyniki o ponad 30% szybciej niż Opus 5.

Wesprzyj redakcję i dodaj PC Format do ulubionych źródeł w Google. To dla nas bardzo ważne!

0 komentarzy

Zostaw komentarz