GPT
G

gpt-oss-20b-GGUF

קוד פתוח

unslothapache-2.02025-08-05

  • transformers
  • gguf
  • gpt_oss
  • text-generation
  • openai

גרסת GGUF של מודל החשיבה והסוכנים הפתוח מבית OpenAI, המותאמת להרצה מקומית קלה. היא מציעה שרשרת חשיבה מלאה ושליטה בעומק ההסקה בחבילה שנכנסת לחומרה נגישה.

  • 131,072טוקנים בהקשר
  • 178 GBמשקל הקבצים
  • 560,054הורדות בחודש
  • 809לייקים

מה זה

הפרויקט הזה מנגיש את משקלי gpt-oss-20b בתצורת GGUF בעזרת llama.cpp. הארכיטקטורה מבוססת על מודל MoE הכולל 21 מיליארד פרמטרים בסך הכל, אך מפעיל רק 3.6 מיליארד פרמטרים בכל טוקן. המבנה הזה מקצר משמעותית את זמן ההמתנה לתשובה ביחס למודלים צפופים בגודל דומה, תוך שמירה על חלון הקשר ענק של 131,072 טוקנים.

בבסיסו הוא תוכנן לעבודה כסוכן אוטונומי, וכולל תמיכה מובנית בקריאת פונקציות, הרצת קוד פייתון, גלישה ברשת ופלט במבנה מוגדר. בנוסף, אפשר להגדיר בפרומפט את רמת מאמץ החשיבה בין נמוכה, בינונית וגבוהה, בהתאם לדרישות המהירות והעומק של המשימה.

מתאים ל

  • סוכנים אוטונומיים

    הוא כולל יכולות טבעיות לקריאת פונקציות, הרצת קוד וגלישה שמקצרות פיתוח סוכנים.

  • פיתוח מקומי חסכוני

    מפעיל רק 3.6 מיליארד פרמטרים מתוך 21 ונכנס לחומרה צרכנית עם 16GB זיכרון.

  • משימות חשיבה מבוקרות

    מאפשר לשלוט על עומק החשיבה ולנתח את שרשרת ההסקה המלאה לפני הפקת הפלט.

איפה זה נופל

המגבלה הקריטית ביותר היא פורמט התגובה harmony. המודל אומן ספציפית עליו, ובלי שימוש בתבנית הזו הוא לא יתפקד כראוי. בנוסף, הוא פולט שרשרת חשיבה מלאה, שנועדה לניפוי שגיאות ומעקב פיתוח אך אינה מיועדת להצגה ישירה למשתמשי קצה במוצר.

אותה משפחה

gpt-oss יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ אותו מקומית?

הוא מתוכנן לפעול בתוך 16GB של זיכרון, כך שכרטיס מסך מודרני בנפח כזה יספיק להרצה. הודות לשימוש ב־3.6 מיליארד פרמטרים פעילים, הביצועים שלו מהירים משמעותית ממודלים צפופים בעלי 20 מיליארד פרמטרים.

למה המודל מחזיר פלט משובש בהרצה ישירה?

המודל מחייב שימוש בפורמט harmony שבו הוא אומן. אם עובדים ישירות עם generate ב־Transformers ללא התבנית המתאימה או בלי חבילת openai-harmony, הפלט לא יעבוד כמו שצריך.

איך מריצים

כדי להריץ אותו מקומית מנצלים את קובצי ה־GGUF דרך llama.cpp, Ollama או LM Studio, וקיימת גם תמיכה ב־vLLM וב־Transformers. המודל מאומן במקור בכיול MXFP4 לשכבות ה־MoE, כך שהוא נכנס לתוך 16GB זיכרון ומתאים לכרטיסי מסך ביתיים ללא שרת ייעודי.

גרסת F32 שמופיעה כאן היא שחזור של MXFP4 לתוך BF16 בכל שכבה וללא קוונטיזציה נוספת. אם יש לכם GPU ביתי סביר, תריצו מקומית דרך Ollama, אך למערכות ייצור עם תעבורה כבדה עדיף לפרוס שרת vLLM מסודר או להשתמש בנקודת קצה מנוהלת.

ollama run hf.co/unsloth/gpt-oss-20b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לבצע התאמות ופיין-טיונינג ולהפיץ אותו בתוך מוצרים חופשיים או מסחריים, ללא דרישה לחשיפת קוד המקור ומבלי להסתכן בזכויות פטנטים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗