ניו-טק מגזין | יולי 2026 | המהדורה הדיגיטלית

2,000־ מספקת יותר מ Cerebras מנגד, GPT - טוקנים לשנייה למשתמש עבור המודל , תוך שמירה על תפוקה עקבית OSS-120B ובתצורה חסכונית יותר עבור היקף ביצועים זה. החברה השיקה את שירות הענן שלה , על בסיס הטכנולוגיה 2024 להיסק כבר בסוף שלה עצמה, וכך הדגימה מהו "מצב האפשרי" בפועל. להלן דוגמה נוספת, עבור מודל גדול אף יותר, כאשר כל יתר הספקים פועלים על .) 6 (ראה איור GPU בסיס טוקנים לשנייה 60,000 אם דרישה של נשמעת גבוהה, חשוב להבין את מימד האינטראקטיביות הסמויה שמוטמע אפילו בשיחת צ'אט פשוטה. נניח שלקוח בנק שואל: "כמה כסף הוצאתי על מסעדות בחודש שעבר?" זו בקשה קצרה מאוד, שניתן לייצג בכמה עשרות טוקנים בלבד. גם התשובה 500 הסופית תהיה קצרה - למשל: "הוצאת ש"ח על מסעדות בחודש האחרון" - אך בין השאלה לבין התשובה המערכת עשויה לייצר לשאילתה על מערכת SQL בזמן אמת קוד לניתוח Python הליבה הבנקאית, וכן קוד התוצאה. כל זאת תוך שילוב הקשר נוסף והנחיות מערכת שמבטיחות עמידה ברגולציה פיננסית ואחרת. המשמעות היא שבפועל יש לעבד במהירות אלפי טוקנים, ולעיתים אף עשרות אלפים, כדי שחוויית השיחה בין תישאר מהירה, רציפה AI המשתמש לבין ה וטבעית. במבט זה, ברור כיצד מחיר תשתית היסק עלולה להתרחב GPU המבוססת על במהירות רבה, ובכל זאת להציע למשתמש . את Cerebras קצה מהירות נמוכה מזו של בתחום ניתן לראות Cerebras עליונותה של .) 7 באיור ההשוואתי הבא (איור Cerebras אישור משמעותי נוסף למעמדה של , כאשר החברה הודיעה על 2026 הגיע בתחילת עם Master Relationship Agreement חתימת לרכישת קיבולת היסק בהיקף של OpenAI מגה־ואט, בפריסה מדורגת לאורך שלוש 750 OpenAI שנים. בהודעה הרשמית התייחס נציג בדיוק לאותו צורך באינטראקטיביות: מוסיפה לפלטפורמה שלנו פתרון Cerebras " היסק ייעודי בעל השהיה נמוכה. המשמעות היא תגובות מהירות יותר, אינטראקציות טבעיות יותר ותשתית חזקה יותר להרחבת בזמן אמת למספר גדול בהרבה של AI השיקה על גבי OpenAI משתמשים". מאז, GPT 5.3 את המודל Cerebras טכנולוגיית לכתיבת קוד - תחום שמסתמן Codex Spark כאחד ממקרי השימוש המרכזיים ביותר ב־

לבין ספקי היסק מבוססי Cerebras השוואת מהירות למשתמש ותפוקה כוללת בין :6 איור « )https://artificalanalysis.ai/models/glm-4-7/providers מקור: ( . GPU

GPT-OSS-120B השוואת ביצועי פרוססורים שונים בהיסק מבוסס :7 איור « ) https://artificalanalysis מקור: (

, הן באופן ישיר והן בעקיפין, Generative AI כפי שהודגם בדוגמת הבנקאות לעיל. האירוע המשמעותי האחרון במסעה של אל עבר ההנפקה היה ההכרזה על Cerebras סביב מה שמכונה AWS שיתוף פעולה עם . בגישה זו, שלב ה־ disaggregated inference מתבצע על גבי מעבד ממוטב-חישוב כגון prefill מבוצע decode , ואילו שלב ה־ AWS Trainium , שנהנה מיתרון מובהק בביצועי WSE על גבי AWS זיכרון. כאשר גישה זו תסופק באמצעות , היא צפויה לאפשר היסק מהיר Bedrock ויעיל אף יותר עבור משתמשי הקצה. ולבסוף, יש להביא בחשבון גם את הלך הרוח AI הרחב יותר בתעשייה: משאבי מחשוב ל נמצאים כיום בביקוש גבוה, ולעיתים אספקת 12–10 הזמנות גדולות מתבצעת רק כעבור חודשים ממועד ההזמנה. במקביל, ניכרות GPU - as - a - גם עליות מחירים אצל ספקי , המשקפות את הזינוק בביקוש. Service עדיין נמשך, אך ממנו Cerebras סיפורה של

עולה גם לקח חשוב עבור ספקי ומפעילי בישראל. נקודת המוצא צריכה להיות AI צורכי משתמש הקצה והבנה מדויקת של רמות האינטראקטיביות - הן הגלויות והן הסמויות. ראוי ומומלץ לשקול חלוקה כפולה לצורך היסק איט GPU של התשתית: מחיצת ולמודלי GenAI יחסית או למודלים שאינם קטנים - למשל לצורכי המרת דיבור LLM לטקסט או טקסט לדיבור, ולצידה מחיצת לצורך היסק מהיר ואינטראקטיבי Cerebras בקנה מידה גדול. בנוסף, מומלץ לחשוב קדימה, להביא בחשבון את מציאות מגבלות שרשרת האספקה, ולפעול באגרסיביות רבה יותר ברכש ובהזמנת קיבולת - עוד לפני שהביקוש העתידי יתממש בפועל. ניסקו פרוייקטים היא נציגתה הרשמית של בישראל. Cerebras לפרטים נוספים ניתן לפנות למיקי קליין, miki @ nisko . co . il , 054-5550750

New-Tech Magazine l 48

Made with FlippingBook Ebook Creator