
#OpenAIInferenceCostTest
About OpenAIInferenceCostTest
OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio
Popularne
Najnowsze
OpenAIInferenceCostTest Popularne wpisy
#OpenAIQ2LossWidens
Szybko rozwijające się firmy nie zawsze stają się świetnymi biznesami.
OpenAI nadal rośnie, ale straty również się powiększają. Anthropic podąża inną ścieżką, pokazując wczesne oznaki rentowności. Przychody przyciągają uwagę.
Zrównoważona ekonomia zwykle decyduje o zwycięzcy maratonu. Co jest dla Ciebie dziś ważniejsze, wzrost czy rentowność?

AKTUALNOŚCI: Szanse na IPO Anthropic przewyższają wzrost wyceny SpaceX $SPCX do 1,77 biliona dolarów.

Cała uwaga wokół Jalapeño wydaje się skupiona na wydajności w porównaniu z Nvidią, ale tempo inżynieryjne stojące za tym jest naprawdę niezwykłe. Kilka najważniejszych punktów z prezentacji @hotchipsorg:
1. Budowa niestandardowych chipów kiedyś wymagała ogromnych zespołów inżynierów i wieloletnich harmonogramów. OpenAI przeszło od początkowego kodu RTL do tapeoutu w zaledwie 9 miesięcy, używając XLS (języka podobnego do Rust od Google do sprzętu) i współprojektowania napędzanego AI.
2. Pętla AI wzięła surowy, ledwo funkcjonujący kernel (DeepSeek) działający z efektywnością 0,31% i autonomicznie zoptymalizowała go do 88,94% fizycznego limitu chipu w mniej niż 2 dni.
3. Kod wygenerowany przez AI działał do 1,8 raza szybciej na krytycznych blokach niż implementacje ręcznie dostrajane przez światowej klasy inżynierów kernelowych.
4. AI zrobiło więcej niż tylko napisało oprogramowanie dla chipu. Zoptymalizowało fizyczne obwody sprzętowe przed tapeoutem.
Jeszcze raz, to nie jest gra o sumie zerowej ani strata netto dla Nvidii. Niestandardowe ASICi odblokowują absurdalne efektywności serwowania dla wyspecjalizowanych obciążeń i rozszerzą całkowity tort obliczeniowy dla całej branży.
Od czasu ogłoszenia Jalapeño, naszego pierwszego niestandardowego układu do wnioskowania, testowaliśmy go oraz system wokół niego.
Wyniki pokazują znaczący postęp: więcej inteligencji z każdego wata i szybsze reakcje, zapewniając zarówno wyższą przepustowość, jak i niższe opóźnienia w jednej architekturze bez poświęcania efektywności.

OpenAI twierdzi, że jego nowy chip AI Jalapeño może znacznie obniżyć koszty uruchamiania sztucznej inteligencji, ale Jim Cramer (@jimcramer) pozostaje sceptyczny co do tego, czy stanowi poważne zagrożenie dla Nvidia ($NVDA).
Jalapeño to pierwszy niestandardowy chip inferencyjny OpenAI, opracowany we współpracy z Broadcom ($AVGO). Firma planuje rozpocząć jego wewnętrzne wdrażanie do końca 2026 roku, a produkcja ma się zwiększyć w 2027 roku.
CEO OpenAI, Sam Altman (@sama), opisał chip krótko, mówiąc: „Zrobiliśmy chip i jest szybki.” Firma już pracuje nad drugą i trzecią generacją.
OpenAI twierdzi, że Jalapeño może zapewnić zarówno wyższą przepustowość, jak i niższe opóźnienia, co jest trudne do osiągnięcia. Wewnętrzne testy wykazały lepszą wydajność na wat niż systemy Nvidia GB200 i GB300 w kilku dużych modelach AI.
W zależności od obciążenia, OpenAI twierdzi, że Jalapeño dostarcza około 1,5x do 1,9x więcej wydajności na wat oraz znacznie niższe opóźnienia. Chip jest zaprojektowany specjalnie do inferencji, a nie do treningu AI.
Dyrektor ds. sprzętu OpenAI, Richard Ho, powiedział, że te zyski efektywności mogą ostatecznie przełożyć się na niższe ceny tokenów dla klientów, gdy chip wejdzie do produkcji na większą skalę.
Mimo to OpenAI nie planuje całkowicie zastąpić Nvidii. Firma zapowiedziała, że będzie nadal korzystać z akceleratorów Nvidia oraz sprzętu innych partnerów zarówno do treningu, jak i inferencji.
Cramer odrzucił pomysł, że każdy nowy chip AI stanowi realnego konkurenta dla Nvidii. Powiedział, że regularnie słyszy o lepszych chipach, ale nadal nie widzi „prawdziwych konkurentów” dla Nvidii na dużą skalę.


Jalapeno od OpenAI to sygnał, że branża AI wchodzi w erę „posiadania całego stosu”.
Dawniej strategia polegała na trzymaniu się swojego obszaru i skupieniu.
Firmy zajmujące się modelami trenowały modele. Firmy produkujące chipy robiły chipy. Firmy zajmujące się danymi zbierały dane.
Ta era się skończyła.
OpenAI zaczynało jako czyste laboratorium modeli. Teraz projektują własne układy scalone i optymalizują całe systemy wokół swoich rzeczywistych obciążeń.
W tym tygodniu widzieliśmy też, jak @Figure_robot wchodzi na warstwę danych i uruchamia Index, własne działania związane ze zbieraniem danych obejmujące 108 krajów.
Wszyscy przesuwają się w górę i w dół stosu.
Część z tego prawdopodobnie ma na celu pogłębienie wąskich fos, część to cięcie kosztów, a część to uzasadnienie wycen.

OpenAI stworzyło niestandardowy układ inferencyjny (Jalapeño) i przeszło od pierwszego RTL do tapeoutu w 9 miesięcy.
Kiedy projektowałem i tapeoutowałem złożone SoC, 18–24 miesiące od RTL do tapeoutu było normą. Weryfikacja i projektowanie fizyczne zajmowały większość tego czasu.
Pisanie Verilog/VHDL przez AI jest dość oczekiwane przy wszystkich agentach kodujących. Imponujące było to, że zespół @OpenAI użył wewnętrznego modelu z szybkim sprzężeniem zwrotnym QoR i solidną weryfikacją do optymalizacji RTL
AI naprawdę skraca cykl projektowania... dobre dla wszystkich. Zobaczymy więcej krzemów i więcej innowacji. Teraz różnicowanie przenosi się na zabezpieczenie pojemności TSMC i alokacji HBM..
Można zaprojektować więcej układów... ale mniej można wyprodukować na skalę.



OpenAI poważnie podchodzi do posiadania całego stosu AI
Jalapeño wreszcie przechodzi z fazy testów do infrastruktury OpenAI
> więcej pracy AI z każdego wata
> wyższa przepustowość przy niższej latencji
> szybsze odpowiedzi ChatGPT i Codex
to jest tylko Gen 1, Gen 2 jest już w fazie rozwoju, a Gen 3 zaczyna się kształtować.
OpenAI ma już modele, użytkowników i popyt.
teraz buduje też moc obliczeniową pod nimi.
prawdziwe pytanie brzmi, jak daleko to zajdzie, gdy Jalapeño zacznie skalować się w całej ich infrastrukturze.
jak myślisz, jak będzie wyglądać Gen 2?


Od czasu ogłoszenia Jalapeño, naszego pierwszego niestandardowego układu do wnioskowania, testowaliśmy go oraz system wokół niego.
Wyniki pokazują znaczący postęp: więcej inteligencji z każdego wata i szybsze reakcje, zapewniając zarówno wyższą przepustowość, jak i niższe opóźnienia w jednej architekturze bez poświęcania efektywności.
Wczesne testy Jalapeño OpenAI wskazują na potencjalnie istotną zmianę w ekonomii inferencji: 1,5x-1,9x większa przepustowość na wat oraz 1,7x-3,6x niższa latencja end-to-end w modelach otwartych. Podobno GPT-5.6 Sol używał także o 54% mniej tokenów wyjściowych niż czołowy konkurent w zadaniach programistycznych.
Ocena jest taka, że zyski efektywności mogą poprawić ekonomię jednostkową, ale testy firmy nie są jeszcze dowodem na niższe łączne koszty. Przy 6,7 mld USD przychodów w Q2 wobec 12,3 mld USD straty operacyjnej, wdrożenie na dużą skalę i wzrost obciążenia będą ważniejsze niż wyniki na poziomie nagłówka. To nie porada, tylko analiza.
#OpenAIInferenceCostTest

Pierwszy niestandardowy układ inferencyjny OpenAI zapewnia wyższą przepustowość, niższe opóźnienia i lepszą wydajność w jednej architekturze.
Gdy największe laboratorium AI zaczyna projektować własny układ scalony, ekonomia inferencji na dużą skalę napotyka problem.
Warstwa obliczeniowa jest przebudowywana od podstaw.
Od czasu ogłoszenia Jalapeño, naszego pierwszego niestandardowego układu do wnioskowania, testowaliśmy go oraz system wokół niego.
Wyniki pokazują znaczący postęp: więcej inteligencji z każdego wata i szybsze reakcje, zapewniając zarówno wyższą przepustowość, jak i niższe opóźnienia w jednej architekturze bez poświęcania efektywności.


