GPT
G

gpt-oss-20b

קוד פתוח

openaiapache-2.02025-08-04

  • transformers
  • safetensors
  • gpt_oss
  • text-generation
  • vllm

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

מודל משקלים פתוחים של OpenAI שמתוכנן להסקה מהירה מקומית. הוא כולל 21 מיליארד פרמטרים אבל מפעיל רק 3.6 מיליארד בכל טוקן, כך שהוא נכנס לכרטיסי מסך ביתיים.

  • 21Bפרמטרים
  • 131,072טוקנים בהקשר
  • 38.5 GBמשקל הקבצים
  • 6,551,191הורדות בחודש

מה זה

הארכיטקטורה כאן מבוססת תערובת מומחים, מה שאומר שגודל המודל הכולל עומד על 21 מיליארד פרמטרים, אבל בזמן ריצה בפועל פועלים רק 3.6 מיליארד פרמטרים אקטיביים. השילוב הזה נותן זמני תגובה מהירים מאוד ביחס למודלים צפופים בגודל דומה. המשקלים עברו אימון המשך עם קוונטיזציה של ארבע ביט מסוג MXFP4, מה שמכווץ את דרישות הזיכרון בלי להצריך המרות מסובכות בעצמכם.

המודל כולל יכולות חשיבה מובנות עם שרשרת מחשבה מלאה, שמאפשרת לראות בדיוק את תהליך ההסקה לפני התשובה הסופית. אפשר להגדיר את רמת המאמץ של המחשבה לשלוש רמות לפי הצורך במהירות מול עומק ניתוח. בנוסף, הוא מגיע עם תמיכה ישירה בהפעלת פונקציות, הרצת קוד פייתון, פלט מובנה וגלישה ברשת, ומציע חלון הקשר רחב של 131,072 טוקנים שמתאים לטקסטים ארוכים במיוחד.

מתאים ל

  • סוכני אוטומציה מקומיים

    הוא כולל תמיכה מובנית בהרצת קוד פייתון, קריאות לפונקציות ודפדפן, בלי צורך בעטיפות חיצוניות.

  • חילוץ מידע למבנה נתונים

    התמיכה המובנית בפלט מובנה מאפשרת להוציא אובייקטים מוגדרים היטב מטקסטים ארוכים.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין קבצים גדולים שלמים לתוך כרטיס מסך בודד.

איפה זה נופל

החולשה העיקרית היא התלות המוחלטת במבנה הפלט harmony. אם תנסו להריץ טקסט חופשי בלי התבנית הזו או בלי החבילה של OpenAI, הפלט פשוט ישתבש. בנוסף, שרשרת המחשבה המלאה לא מיועדת להצגה ישירה למשתמשי קצה לפי התיעוד, כך שתצטרכו לנקות אותה בצד השרת לפני שמציגים תשובות. זה מודל קטן יחסית עם 3.6 מיליארד פרמטרים פעילים, ולכן במשימות עמוקות מאוד הוא עדיין ייפול מול המודל הגדול יותר.

אותה משפחה

gpt-oss יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אני חייב להשתמש בפורמט harmony?

כן. הכרטיס מדגיש שהמודל לא יעבוד כשורה בלי פורמט התגובה הזה. אם אתם עובדים עם Transformers יש להשתמש בטמפלייט השיחה שלו, או בחבילת openai-harmony שמספקת את ההגדרות הנדרשות.

האם אפשר להציג למשתמשים את תהליך החשיבה של המודל?

היצרן מבהיר במפורש ששרשרת המחשבה נועדה לבדיקות, דיבוג ובקרה פנימית שלכם. היא לא מיועדת לחשיפה ישירה מול משתמשי קצה במוצר.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם זיכרון של 16GB לפחות. בזכות הקוונטיזציה המקורית והארכיטקטורה שלו, הוא רץ ישירות בסביבות מקומיות כמו Ollama או LM Studio, וגם בשרתי היקש דוגמת vLLM וספריית Transformers עם חבילת kernels ייעודית. הקבצים המלאים שוקלים 38.5 ג'יגה בייט, אז קחו בחשבון את זמן ההורדה והאחסון.

אם יש לכם מעבד גרפי ביתי מתאים, ההרצה המקומית הגיונית לגמרי וחוסכת עלויות. מצד שני, אם אתם צריכים שירות יציב לעומסי ייצור כבדים או משימות חשיבה מורכבות במיוחד, המודל הגדול יותר בסדרה, 120B, או פנייה לנקודת קצה מנוהלת בענן יתנו תוצאות טובות יותר בלי לנהל תשתית שרתים בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="openai/gpt-oss-20b")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם יכולים לקחת את המשקלים, לשנות אותם, לאמן אותם מחדש, לשלב אותם במוצר מסחרי סגור ולמכור אותו בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗