GPT
G

gpt-oss-puzzle-88B

קוד פתוח

nvidiaother2026-03-25

  • transformers
  • safetensors
  • gpt_oss_puzzle
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת ומותאמת של gpt-oss-120b שנועדה לחסוך זיכרון ולהאיץ משימות חשיבה מורכבות. אם אתם מריצים שרת H100 משלכם ורוצים ביצועי היגיון בלי לשלם על מודל ענק, זו נקודת פתיחה טובה.

  • 91Bפרמטרים
  • 229,376טוקנים בהקשר
  • 46.6 GBמשקל הקבצים
  • 1,631הורדות בחודש

מה זה

מדובר במודל MoE שנולד מדחיסה של מודל המקור בן 120 מיליארד הפרמטרים של OpenAI. אנבידיה השתמשה בארכיטקטורה שמסירה מומחים באופן לא אחיד בין השכבות, ושילבה מנגנון window attention על חלק מהשכבות כדי לצמצם את תפיסת הזיכרון של ה־KV cache בכארבעים אחוז בהקשרים ארוכים.

בפועל, השינויים האלה נועדו לפתור את צוואר הבקבוק המרכזי של מודלי חשיבה, שהוא רוחב הפס של הזיכרון ולא כוח החישוב עצמו. המדידות מראות שיפור של פי 1.63 בקצב העיבוד בהקשרים ארוכים של 64K מול מודל הבסיס על שרת של שמונה כרטיסי H100, ושיפור של עד פי 2.82 בכרטיס בודד, בלי ירידה ברמת הדיוק במשימות קוד ומתמטיקה.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    המודל אומן ב־RL ייעודי לקוד ומתמטיקה עם תמיכה בשלוש רמות מאמץ חשיבה לשליטה על עלויות.

  • ניתוח מסמכים ארוכים

    מנגנון הקשב המשולב חוסך מקום ב־KV cache ומאפשר עיבוד מהיר יותר של עשרות אלפי טוקנים.

  • הסקה מהירה על שרת H100

    הארכיטקטורה הותאמה ספציפית לצווארי הבקבוק של כרטיסי H100 ומספקת קצב פלט גבוה משמעותית.

איפה זה נופל

המודל תומך רשמית באנגלית בלבד, כך שמי שמפתח מוצר שמיועד לעברית צפוי להיתקל בבעיות הבנה ותרגום קלוקל. מעבר לזה, הכרטיס מציין אורך הקשר מקסימלי של 128K טוקנים לקלט ולפלט, למרות שהמפרט הטכני מציין חלון תיאורטי רחב יותר, מה שדורש בדיקה קפדנית אם בונים על מסמכים ארוכים במיוחד. בנוסף, חומרת היעד מוגבלת מאוד, וללא כרטיסי H100 או B200 קשה לצפות לביצועים המדווחים.

שאלות
נפוצות

האם המודל יתאים לעיבוד טקסטים בעברית?

הכרטיס מגדיר במפורש את שפת המודל כאנגלית בלבד. הוא לא עבר אימון ייעודי לעברית, ולכן לא הייתי מסתמך עליו במוצר מקומי בלי לבדוק ביצועים באופן עצמאי.

איך שולטים באורך התשובה ובזמן החישוב?

המודל כולל שלושה מצבי מאמץ חשיבה: נמוך לתשובות קצרות ומהירות, בינוני, וגבוה למשימות חשיבה מרובות שלבים. המצבים האלה מאפשרים לווסת את כמות הטוקנים שנוצרת וכך לשלוט בעלויות ההרצה.

האם אפשר להריץ אותו על גבי שרת מקומי רגיל?

לא. התמיכה המוגדרת היא לכרטיסי H100 בנפח 80GB או כרטיסי B200 תחת מערכת הפעלה לינוקס, והוא דורש מנוע הרצה כמו vLLM.

איך מריצים

בכרטיס המודל מצוינת תאימות לחומרת NVIDIA H100-80GB ו־B200 בלבד, כך שאין טעם לנסות להרים אותו על כרטיסי צרכנים או תחנות קצה רגילות. המשקל הוא כ־46.6 גיגה-בייט הודות לכימות MXFP4 של משקלי המומחים, ומריצים אותו על גבי לינוקס באמצעות מנוע vLLM או ספריית Transformers.

אם אין לכם קלאסטר שרתים או כרטיס H100 ייעודי בענן, העלויות השעתיות של חומרה כזו יהפכו את הניסוי ליקר מאוד תוך זמן קצר. במצב כזה, עדיף להשתמש ב־API מנוהל שמחייב לפי טוקנים במקום לשכור שרת ארגוני יקר.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/gpt-oss-puzzle-88B")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון NVIDIA Open Model License, והכרטיס מגדיר אותו כמיועד לשימוש מסחרי. עם זאת, ברישום ב־Hugging Face הרישיון מסומן כ־other, ולכן חובה לקרוא את תנאי הרישיון של אנבידיה לפני שילוב שלו במוצר מסחרי כדי לוודא שאין מגבלות הפצה או שימוש ספציפיות בענף שלכם.

הרישיון המלא בעמוד המודל ↗