#OpenAIInferenceCostTest

702,1 tys. oglądających|216 wpis

About OpenAIInferenceCostTest

OpenAI shared early tests of Jalapeño, its first in-house inference chip. It says it delivers 1.5x-1.9x more throughput per watt on open models and cuts end-to-end latency by 1.7x-3.6x. Deployment is planned by year-end, with two successors in development. It also says GPT-5.6 Sol used 54% fewer output tokens than a leading rival on coding tasks. After $6.7B in Q2 revenue and a $12.3B operating loss, can these company-tested gains lower inference costs, narrow losses and support its IPO valuatio

OpenAIInferenceCostTest Popularne wpisy

TBNG_OKX
TBNG_OKX
#OpenAIQ2LossWidens Szybko rozwijające się firmy nie zawsze stają się świetnymi biznesami. OpenAI nadal rośnie, ale straty również się powiększają. Anthropic podąża inną ścieżką, pokazując wczesne oznaki rentowności. Przychody przyciągają uwagę. Zrównoważona ekonomia zwykle decyduje o zwycięzcy maratonu. Co jest dla Ciebie dziś ważniejsze, wzrost czy rentowność?
Watcher_Guru
Watcher_Guru
AKTUALNOŚCI: Szanse na IPO Anthropic przewyższają wzrost wyceny SpaceX $SPCX do 1,77 biliona dolarów.
anand iyer
anand iyer
Cała uwaga wokół Jalapeño wydaje się skupiona na wydajności w porównaniu z Nvidią, ale tempo inżynieryjne stojące za tym jest naprawdę niezwykłe. Kilka najważniejszych punktów z prezentacji @hotchipsorg: 1. Budowa niestandardowych chipów kiedyś wymagała ogromnych zespołów inżynierów i wieloletnich harmonogramów. OpenAI przeszło od początkowego kodu RTL do tapeoutu w zaledwie 9 miesięcy, używając XLS (języka podobnego do Rust od Google do sprzętu) i współprojektowania napędzanego AI. 2. Pętla AI wzięła surowy, ledwo funkcjonujący kernel (DeepSeek) działający z efektywnością 0,31% i autonomicznie zoptymalizowała go do 88,94% fizycznego limitu chipu w mniej niż 2 dni. 3. Kod wygenerowany przez AI działał do 1,8 raza szybciej na krytycznych blokach niż implementacje ręcznie dostrajane przez światowej klasy inżynierów kernelowych. 4. AI zrobiło więcej niż tylko napisało oprogramowanie dla chipu. Zoptymalizowało fizyczne obwody sprzętowe przed tapeoutem. Jeszcze raz, to nie jest gra o sumie zerowej ani strata netto dla Nvidii. Niestandardowe ASICi odblokowują absurdalne efektywności serwowania dla wyspecjalizowanych obciążeń i rozszerzą całkowity tort obliczeniowy dla całej branży.
OpenAI
OpenAI
Od czasu ogłoszenia Jalapeño, naszego pierwszego niestandardowego układu do wnioskowania, testowaliśmy go oraz system wokół niego. Wyniki pokazują znaczący postęp: więcej inteligencji z każdego wata i szybsze reakcje, zapewniając zarówno wyższą przepustowość, jak i niższe opóźnienia w jednej architekturze bez poświęcania efektywności.
ℏεsam
ℏεsam
OpenAI użyło AI (modele Sol i Astra), aby pomóc zaprojektować chipy Jalapeño, które będą obsługiwać AI.
Benzinga
Benzinga
OpenAI twierdzi, że jego nowy chip AI Jalapeño może znacznie obniżyć koszty uruchamiania sztucznej inteligencji, ale Jim Cramer (@jimcramer) pozostaje sceptyczny co do tego, czy stanowi poważne zagrożenie dla Nvidia ($NVDA). Jalapeño to pierwszy niestandardowy chip inferencyjny OpenAI, opracowany we współpracy z Broadcom ($AVGO). Firma planuje rozpocząć jego wewnętrzne wdrażanie do końca 2026 roku, a produkcja ma się zwiększyć w 2027 roku. CEO OpenAI, Sam Altman (@sama), opisał chip krótko, mówiąc: „Zrobiliśmy chip i jest szybki.” Firma już pracuje nad drugą i trzecią generacją. OpenAI twierdzi, że Jalapeño może zapewnić zarówno wyższą przepustowość, jak i niższe opóźnienia, co jest trudne do osiągnięcia. Wewnętrzne testy wykazały lepszą wydajność na wat niż systemy Nvidia GB200 i GB300 w kilku dużych modelach AI. W zależności od obciążenia, OpenAI twierdzi, że Jalapeño dostarcza około 1,5x do 1,9x więcej wydajności na wat oraz znacznie niższe opóźnienia. Chip jest zaprojektowany specjalnie do inferencji, a nie do treningu AI. Dyrektor ds. sprzętu OpenAI, Richard Ho, powiedział, że te zyski efektywności mogą ostatecznie przełożyć się na niższe ceny tokenów dla klientów, gdy chip wejdzie do produkcji na większą skalę. Mimo to OpenAI nie planuje całkowicie zastąpić Nvidii. Firma zapowiedziała, że będzie nadal korzystać z akceleratorów Nvidia oraz sprzętu innych partnerów zarówno do treningu, jak i inferencji. Cramer odrzucił pomysł, że każdy nowy chip AI stanowi realnego konkurenta dla Nvidii. Powiedział, że regularnie słyszy o lepszych chipach, ale nadal nie widzi „prawdziwych konkurentów” dla Nvidii na dużą skalę.
LJW
LJW
Jalapeno od OpenAI to sygnał, że branża AI wchodzi w erę „posiadania całego stosu”. Dawniej strategia polegała na trzymaniu się swojego obszaru i skupieniu. Firmy zajmujące się modelami trenowały modele. Firmy produkujące chipy robiły chipy. Firmy zajmujące się danymi zbierały dane. Ta era się skończyła. OpenAI zaczynało jako czyste laboratorium modeli. Teraz projektują własne układy scalone i optymalizują całe systemy wokół swoich rzeczywistych obciążeń. W tym tygodniu widzieliśmy też, jak @Figure_robot wchodzi na warstwę danych i uruchamia Index, własne działania związane ze zbieraniem danych obejmujące 108 krajów. Wszyscy przesuwają się w górę i w dół stosu. Część z tego prawdopodobnie ma na celu pogłębienie wąskich fos, część to cięcie kosztów, a część to uzasadnienie wycen.
Baris
Baris
OpenAI stworzyło niestandardowy układ inferencyjny (Jalapeño) i przeszło od pierwszego RTL do tapeoutu w 9 miesięcy. Kiedy projektowałem i tapeoutowałem złożone SoC, 18–24 miesiące od RTL do tapeoutu było normą. Weryfikacja i projektowanie fizyczne zajmowały większość tego czasu. Pisanie Verilog/VHDL przez AI jest dość oczekiwane przy wszystkich agentach kodujących. Imponujące było to, że zespół @OpenAI użył wewnętrznego modelu z szybkim sprzężeniem zwrotnym QoR i solidną weryfikacją do optymalizacji RTL AI naprawdę skraca cykl projektowania... dobre dla wszystkich. Zobaczymy więcej krzemów i więcej innowacji. Teraz różnicowanie przenosi się na zabezpieczenie pojemności TSMC i alokacji HBM.. Można zaprojektować więcej układów... ale mniej można wyprodukować na skalę.
MaeveKnows
MaeveKnows
OpenAI poważnie podchodzi do posiadania całego stosu AI Jalapeño wreszcie przechodzi z fazy testów do infrastruktury OpenAI > więcej pracy AI z każdego wata > wyższa przepustowość przy niższej latencji > szybsze odpowiedzi ChatGPT i Codex to jest tylko Gen 1, Gen 2 jest już w fazie rozwoju, a Gen 3 zaczyna się kształtować. OpenAI ma już modele, użytkowników i popyt. teraz buduje też moc obliczeniową pod nimi. prawdziwe pytanie brzmi, jak daleko to zajdzie, gdy Jalapeño zacznie skalować się w całej ich infrastrukturze. jak myślisz, jak będzie wyglądać Gen 2?
OpenAI
OpenAI
Od czasu ogłoszenia Jalapeño, naszego pierwszego niestandardowego układu do wnioskowania, testowaliśmy go oraz system wokół niego. Wyniki pokazują znaczący postęp: więcej inteligencji z każdego wata i szybsze reakcje, zapewniając zarówno wyższą przepustowość, jak i niższe opóźnienia w jednej architekturze bez poświęcania efektywności.
Birdie_OKX
Birdie_OKX
Wczesne testy Jalapeño OpenAI wskazują na potencjalnie istotną zmianę w ekonomii inferencji: 1,5x-1,9x większa przepustowość na wat oraz 1,7x-3,6x niższa latencja end-to-end w modelach otwartych. Podobno GPT-5.6 Sol używał także o 54% mniej tokenów wyjściowych niż czołowy konkurent w zadaniach programistycznych. Ocena jest taka, że zyski efektywności mogą poprawić ekonomię jednostkową, ale testy firmy nie są jeszcze dowodem na niższe łączne koszty. Przy 6,7 mld USD przychodów w Q2 wobec 12,3 mld USD straty operacyjnej, wdrożenie na dużą skalę i wzrost obciążenia będą ważniejsze niż wyniki na poziomie nagłówka. To nie porada, tylko analiza. #OpenAIInferenceCostTest
Raven Protocol 🐦‍⬛
Raven Protocol 🐦‍⬛
Pierwszy niestandardowy układ inferencyjny OpenAI zapewnia wyższą przepustowość, niższe opóźnienia i lepszą wydajność w jednej architekturze. Gdy największe laboratorium AI zaczyna projektować własny układ scalony, ekonomia inferencji na dużą skalę napotyka problem. Warstwa obliczeniowa jest przebudowywana od podstaw.
OpenAI
OpenAI
Od czasu ogłoszenia Jalapeño, naszego pierwszego niestandardowego układu do wnioskowania, testowaliśmy go oraz system wokół niego. Wyniki pokazują znaczący postęp: więcej inteligencji z każdego wata i szybsze reakcje, zapewniając zarówno wyższą przepustowość, jak i niższe opóźnienia w jednej architekturze bez poświęcania efektywności.