GPT
G

gpt-oss-120b

קוד פתוח

openaiapache-2.02025-08-04

  • transformers
  • safetensors
  • gpt_oss
  • text-generation
  • vllm

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

מודל משקולות פתוחות מבית OpenAI עם דגש על יכולות הסקה והפעלת כלים. הוא בנוי כארכיטקטורת תערובת מומחים שמאפשרת להריץ מודל של 117 מיליארד פרמטרים על כרטיס שרת בודד.

  • 117Bפרמטרים
  • 131,072טוקנים בהקשר
  • 182 GBמשקל הקבצים
  • 5,414,162הורדות בחודש

מה זה

המודל כולל 117 מיליארד פרמטרים, אבל מפעיל בפועל רק 5.1 מיליארד פרמטרים בכל טוקן בזכות מבנה תערובת המומחים שלו. משקלי המומחים עברו קוונטיזציה מסוג MXFP4, מה שמאפשר לדחוס את כל הנפח הזה לזיכרון של כרטיס בודד בנפח 80GB מבלי לפגוע במבנה ההסקה הבסיסי שעליו נמדדו הביצועים.

הוא מגיע עם תמיכה מובנית בשלוש רמות הסקה שונות, מה שנותן שליטה ישירה על עומק שרשרת החשיבה וזמן התגובה דרך הפרומפט. מעבר לטקסט רגיל, הוא כולל תמיכה טבעית בהפעלת פונקציות לפי סכמה, הרצת קוד פייתון, גלישה ברשת ופליטת פלט מובנה, ומספק גישה מלאה לשרשרת החשיבה הפנימית לצורכי ניפוי שגיאות ובקרה בהקשר של עד 131,072 טוקנים.

מתאים ל

  • סוכנים מבוססי כלים

    תמיכה מובנית בהרצת קוד פייתון, גלישה ברשת והפעלת פונקציות חיצוניות לפי סכמה.

  • פיתוח עם בדיקת הסקה

    גישה מלאה לשרשרת החשיבה שמאפשרת לאתר כשלים בלוגיקה לפני שליחת התשובה.

  • שרת הסקה בודד

    ארכיטקטורת מומחים מקוונטטת שרצה במלואה על חומרה יחידה של 80GB.

איפה זה נופל

המודל מחייב שימוש קפדני בפורמט התגובה harmony. לפי התיעוד הוא לא יעבוד בצורה תקינה אם מזינים לו פרומפטים ישירות ללא שימוש בתבנית השיחה של Transformers או בחבילת התוכנה הייעודית של הפורמט. בנוסף, אף על פי ששרשרת החשיבה המלאה גלויה למפתח, היא מיועדת לבדיקות ולניפוי שגיאות בלבד ולא להצגה ישירה למשתמשי קצה במוצר.

אותה משפחה

gpt-oss יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד או כרטיס מסך ביתי?

לא. משקל הקבצים הוא 182GB והוא דורש כרטיס מקצועי עם 80GB זיכרון כמו H100 או MI300X. עבור חומרה אישית עדיף לבחור בגרסת ה־20B שדורשת 16GB זיכרון.

למה המודל לא מייצר פלט הגיוני בקריאה ישירה דרך הקוד?

הוא אומן לעבוד אך ורק עם פורמט harmony. קריאות שאינן מפעילות את תבנית השיחה של transformers או את חבילת התאימות של harmony יגרמו לכשלים ביצירת הטקסט.

איך מריצים

בשביל להריץ אותו צריך כרטיס מסך ברמת שרת עם 80GB זיכרון לפחות, כמו NVIDIA H100 או AMD MI300X. בשימוש מקומי אפשר להרים אותו דרך Transformers, vLLM עם חבילת התאימות הייעודית, או דרך Ollama ו־LM Studio, אך המשקל הכולל של הקבצים עומד על 182GB ולכן הורדה וטעינה דורשות אחסון מהיר ונפח משמעותי.

אם אין לכם שרת עם מעבד גרפי של 80GB פנוי או גישה לתשתית ענן מתאימה, אין טעם לנסות לדחוף אותו לחומרה ביתית רגילה. במצב כזה עדיף לפנות לגרסת ה־20B הקטנה יותר שדורשת רק 16GB זיכרון, או לצרוך את המודל דרך ספק API שמארח אותו.

from transformers import pipeline

pipe = pipeline("text-generation", model="openai/gpt-oss-120b")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לבצע עליו כוונון עדין ולשלב אותו במוצרים סגורים בלי חובת שיתוף של הקוד שלכם, כל עוד שומרים על תנאי הייחוס והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗