GPT
G

unsloth/gpt-oss-120b-GGUF

קוד פתוח

unslothapache-2.02025-08-05

  • transformers
  • gguf
  • gpt_oss
  • text-generation
  • openai

גרסת קבצי GGUF למודל הקוד הפתוח הגדול של OpenAI עם 117 מיליארד פרמטרים. הוא מביא יכולות הסקה עמוקות והפעלת כלים ישירות לחומרה שלכם.

  • 131,072טוקנים בהקשר
  • 941 GBמשקל הקבצים
  • 92,224הורדות בחודש
  • 292לייקים

מה זה

מדובר במימוש של ארכיטקטורת תערובת מומחים שכוללת 117 מיליארד פרמטרים בסך הכול, אך מפעילה רק 5.1 מיליארד פרמטרים בכל טוקן. המבנה הזה מאפשר לו לספק יכולות של מודל ענק בלי לדרוש זמני תגובה כבדים של מודל צפוף בגודל הזה. הדגם מאפשר לקבוע את עומק תהליך המחשבה בשלוש רמות שונות, ממענה מהיר לשיחה ועד ניתוח מעמיק ומפורט.

הוא נבנה במקור לעבודה עם סוכנים, ומכיל תמיכה מובנית בהפעלת פונקציות, הרצת קוד פייתון, גלישה ברשת ויצירת פלטים במבנה מוגדר. בנוסף, שרשרת המחשבה המלאה של המודל נגישה לגמרי, מה שמאפשר לראות בדיוק איך הוא הגיע לכל מסקנה לפני שהוא פולט את התשובה הסופית.

מתאים ל

  • סוכנים אוטונומיים

    תמיכה מובנית בהרצת פייתון, גלישה וקריאות לפונקציות מתוך זרימת העבודה.

  • ניתוח לוגי מעמיק

    שליטה ברמת ההסקה וגישה לשרשרת המחשבה המלאה לצורך בקרה.

  • אימון פנימי בארגון

    רישיון מסחרי חופשי ויכולת לבצע כוונון עדין על שרת ייעודי.

איפה זה נופל

החיסרון המרכזי והקריטי כאן הוא פורמט התקשורת. המודל אומן באופן קשיח לעבוד אך ורק עם מבנה התגובה הייעודי של OpenAI שנקרא harmony. אם לא תשתמשו בתבנית השיחה המדויקת של הפורמט הזה, המודל פשוט לא יעבוד בצורה תקינה ויחזיר פלטים שגויים. בנוסף, היצרן מדגיש ששרשרת המחשבה הגלויה מיועדת לבדיקות ופיתוח, ולא להצגה ישירה למשתמשי קצה.

אותה משפחה

gpt-oss יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המחשב האישי שלי יכול להריץ את הגרסה הזו?

לא. מדובר במודל של מעל מאה מיליארד פרמטרים שמחייב זיכרון גרפי עצום, והוא נבנה להתאים לחומרה ברמת שרתים כמו H100. למחשבים שולחניים עדיף לבדוק את הגרסה הקטנה יותר של אותה משפחה, gpt-oss-20b.

איך שולטים ברמת המאמץ של המחשבה שלו?

השליטה נעשית בהוראה ישירה בתוך פרומפט המערכת. אפשר להגדיר לו רמות קבועות של נמוך, בינוני או גבוה לפי המהירות ורמת הפירוט שאתם צריכים למשימה.

איך מריצים

המשקל הכולל של כלל הקבצים במאגר מגיע ל־941 גיגה בייט המחולקים בין 36 קבצים שונים. כדי להריץ את המודל המלא צריך חומרה ייעודית וכבדה מאוד, שכן רק בפורמט הדחוס של שכבות המומחים הוא מתוכנן להיכנס לתוך מאיץ H100 בודד, ודאי שלא למחשב משרדי רגיל. ניתן להשתמש בו ישירות בספריות כמו llama.cpp, vLLM או דרך ספריות ייעודיות כמו Transformers.

אם אין לכם שרת עם מעבדים גרפיים מתאימים וזמינים בריצה רציפה, עדיף להשתמש ב־API מנוהל של ספק ענן. להחזיק תשתית מקומית בשביל מודל כזה שווה את המאמץ רק כשיש דרישות מחמירות של פרטיות מידע, או צורך באימון והתאמה אישית של המשקולות על נתונים פנימיים.

ollama run hf.co/unsloth/gpt-oss-120b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

36 קבצים במאגר, 941 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. זהו רישיון פתוח ומתירני במיוחד שמאפשר שימוש מסחרי מלא, שינוי של המשקולות, אימון נוסף והפצה פנימית או חיצונית בתוך מוצרים. אין חובת קוד פתוח על התוצרים שלכם, ואין מגבלות מיוחדות מעבר לשמירה על הודעת זכויות היוצרים והיעדר אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗