GPT
O

openai_gpt-oss-20b-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-08-05

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF של bartowski למודל 20B מבית OpenAI, שנועדה להרצה מקומית בתוכנות כמו LM Studio או llama.cpp. היא מתאימה למי שרוצה לבדוק מודל של OpenAI ישירות על החומרה שלו.

  • 307 GBמשקל הקבצים
  • 17,266הורדות בחודש
  • 39לייקים

מה זה

מדובר בהמרה של gpt-oss-20b לקובצי GGUF שנוצרה באמצעות llama.cpp build b6096 עם כיול imatrix. הכרטיס מציע עשרות גרסאות קוונטיזציה, אך המפתח מציין במפורש שרשתות ה־FFN של המודל הזה מתנהגות טוב רק בפורמט MXFP4. בגלל שהשכבות האלו נשארות ב־MXFP4 בכל הגרסאות, כמעט ואין הבדל בגודל הקובץ ביניהן, וההמלצה הרשמית היא להוריד פשוט את גרסת ה־MXFP4 המלאה.

הקובץ המומלץ שוקל 12.1GB, והגרסה הכי קטנה מגיעה ל־11.49GB בלבד, כך שאין שום היגיון להתפשר על איכות כדי לחסוך כמה מאות מגה־בייט. אין בעמוד מדדי ביצועים או מבחני דיוק של המודל עצמו, אלא רק נתוני מהירות היסטוריים להמחשת טכנולוגיית repacking על מודל אחר לגמרי, כך שרמת הביצועים שלו במשימות טקסט נותרת לבדיקה מעשית שלכם.

מתאים ל

  • הרצה מקומית ב־LM Studio

    קובץ ה־MXFP4 מתאים לבדיקת יכולות המודל ישירות על מחשב פיתוח חזק בלי לשלוח נתונים החוצה.

  • ניסויי שרשור וערוצי חשיבה

    התבנית הייעודית כוללת ערוצי ניתוח ופרשנות, למי שרוצה לבדוק פלטים במבנה של OpenAI.

  • שילוב במערכות מבוססות llama.cpp

    המודל ארוז בפורמט GGUF תקני שנטען ישירות בתשתיות C++ וספריות תואמות.

איפה זה נופל

המגבלה הבולטת ביותר היא תבנית הפרומפט. הכרטיס מודה שאין תבנית שיחה מוגדרת למודל, והוא משתמש בברירת מחדל שכוללת מבנה ערוצים מורכב, כשהיוצר עצמו מזהיר שהיא עלולה להיות שגויה. בנוסף, כל עשרות גרסאות הקוונטיזציה בעמוד כמעט זהות במשקלן בגלל המגבלה של שכבות ה־FFN, כך שאין גמישות אמיתית בהתאמה למכשירים חלשים.

שאלות
נפוצות

איזה קובץ להוריד מתוך כל הרשימה בעמוד?

הורידו רק את gpt-oss-20b-MXFP4.gguf ששוקל 12.1GB. שאר הגרסאות חוסכות רק כמה מאות מגה־בייט כי שכבות ה־FFN לא עברו כיווץ נוסף, ולכן אין סיבה לפגוע באיכות בשבילן.

האם תבנית השיחה שמופיעה בעמוד תעבוד בוודאות?

לא בטוח. היוצר מציין במפורש שלא הוגדרה תבנית רשמית ולכן שולבה ברירת מחדל, ומומלץ לבדוק את כרטיס המודל המקורי של OpenAI כדי לוודא שאינכם מקבלים פלטים שבורים.

איך מריצים

כדי להריץ אותו במהירות מקסימלית תצטרכו כרטיס מסך עם לפחות 16GB זיכרון וידאו, מה שיאפשר להכניס את כל קובץ ה־12.1GB ל־VRAM ולהשאיר קצת מרווח להקשר. אם יש לכם פחות VRAM, אפשר לפצל את המשקל בין ה־GPU לזיכרון ה־RAM הרגיל במחיר של ירידה משמעותית בקצב יצירת הטוקנים.

מריצים אותו בקלות דרך LM Studio או ישירות בפקודת llama.cpp. ההבדלים בנפח בין הגרסאות המוצעות זניחים לחלוטין, ולכן חבל לבזבז זמן על גרסאות מכווצות כמו IQ2 או Q3. אם אין לכם חומרה מתאימה להחזיק 12GB זיכרון באופן יציב, עדיף להשתמש ב־API חיצוני של מודל מקביל.

ollama run hf.co/bartowski/openai_gpt-oss-20b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד המודל. מבחינה משפטית, זה משאיר את השימוש בו באזור אפור, ואסור לשלב אותו במוצר מסחרי לפני שבודקים את תנאי הרישיון המקוריים של OpenAI בעמוד המקור.

הרישיון המלא בעמוד המודל ↗