GPT
G

gpt-oss-20b-tq3

קוד פתוח

manjunathshivaapache-2.02026-04-08

  • mlx
  • safetensors
  • gpt_oss
  • turboquant
  • quantization

גרסת 3 ביט מכווצת של מודל המומחים מבית OpenAI, המיועדת להרצה מקומית ומהירה על מחשבי מק. הוא נכנס כולו בזיכרון של מחשב עם 16 גיגה ומחזיר קצב מרשים של עשרות טוקנים בשנייה.

  • 2.9Bפרמטרים
  • 131,072טוקנים בהקשר
  • 9.3 GBמשקל הקבצים
  • 1,181הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה של מודל מומחים הכולל 21 מיליארד פרמטרים בסך הכל ו־32 מומחים, כאשר כ־3.6 מיליארד פרמטרים פעילים בכל טוקן. הדחיסה נעשתה בשיטת TurboQuant ל־3 ביט ללא צורך בנתוני כיול. המודל שומר על חלון הקשר מלא של 131,072 טוקנים, ותומך בדחיסת זיכרון הקשר פי ארבעה בגרסה זו כדי שלא יחנוק את המחשב.

במבחני ביצועים הוא מייצר בין 46 ל־94 טוקנים בשנייה על מעבדי אפל, ומגיע עד ל־73 טוקנים בשנייה על מעבד M4 Max. במבחני איכות נקודתיים הוא שולף מחרוזות מתוך טקסט ארוך ללא שגיאה ומייצר פלט נקי בלי לולאות טקסט חוזרות, אבל דורש תשומת לב מיוחדת להגדרות הדגימה.

מתאים ל

  • עוזר פיתוח מקומי במק

    מייצר לוגיקה תקינה לפונקציות בטמפרטורה 0.3 ורץ על מחשב נייד רגיל בלי לשלוח שורות קוד לרשת.

  • תשאול מסמכים ארוכים

    תומך בחלון הקשר רחב של מעל 131 אלף טוקנים עם שליפת פרטים מדויקת מתוך מאגרי טקסט.

  • שרת צ'אט מקומי וחסכוני

    פועל ישירות בזיכרון המחשב ללא השהיות דיסק ומספק ממשק תואם OpenAI לבדיקות מהירות.

איפה זה נופל

המודל יושב על גבול היכולת בכל הנוגע להסקה רב־שלבית, מתמטיקה וכתיבת קוד. אם מריצים אותו בטמפרטורה רגילה של 0.7, הוא נוטה להרים ידיים באמצע בעיות מילוליות או לפלוט קוד שנראה הגיוני אבל מלא בבאגים לוגיים. רק ירידה לטמפרטורה 0.3 מייצבת את החשיבה, וגם אז הוא עלול להמציא ערכים בבדיקות יחידה. בנוסף, דחיסת זיכרון ההקשר דורשת שימוש ברמת דיוק מעורבת של K8 ו־V3, אחרת הפלט מתפרק אחרי כ־800 טוקנים.

שאלות
נפוצות

האם המודל יעבוד בצורה סבירה על מק מיני עם 16 גיגה?

כן, המודל נבדק על תצורה כזו ותופס כ־11 גיגה זיכרון בזמן עבודה יחד עם יישומי רקע של מערכת ההפעלה. הוא נטען במלואו לזיכרון בלי הזרמה אטית מהכונן.

למה התשובות במתמטיקה או בקוד יוצאות שגויות?

המודל רגיש מאוד להגדרות הדגימה. שימוש בטמפרטורה של 0.7 גורם לו לוותר באמצע פתרון או לכתוב באגים, ולכן למשימות כאלה צריך להוריד את הטמפרטורה ל־0.3 ולהגדיר rep-penalty על 1.1.

אפשר להריץ אותו על מחשב עם כרטיס מסך של Nvidia או מעבד אינטל?

לא. המימוש הזה נשען על ספריית mlx ומיועד אך ורק למעבדי אפל סיליקון.

איך מריצים

כדי להריץ אותו צריך מחשב אפל סיליקון מסדרות M1 עד M4 עם 16 גיגה זיכרון מאוחד לפחות, חבילת turboquant-mlx-full וספריית mlx-lm. צריכת הזיכרון המקסימלית בזמן פעולה עומדת על כ־11 גיגה, כך שכל המשקלים יושבים ישירות בזיכרון בלי להזדקק לקריאות איטיות מהכונן. הכלי turboquant-plan מאפשר לבדוק מראש אם המחשב שלכם יעמוד בעומס לפני שמורידים את הקבצים ששוקלים כ־9.3 גיגה.

אפשר להרים שרת מקומי תואם לממשק של OpenAI דרך הפקודה turboquant-serve ולהתחבר אליו עם כל ספרייה מוכרת. אם אין לכם מחשב מק מתאים, אין פה טעם לנסות, ועדיף להשתמש במודל המקורי דרך API של ספק ענן.

pip install -U huggingface_hub
hf download manjunathshiva/gpt-oss-20b-tq3

הרישיון

המודל מופץ תחת רישיון apache-2.0 הפתוח. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה ללא תשלום, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗