GPT
G

gpt-oss-20b-MXFP4-Q8

קוד פתוח

mlx-communityapache-2.02025-08-29

  • mlx
  • safetensors
  • gpt_oss
  • vllm
  • text-generation

גרסה מכווצת של מודל עשרים ואחד מיליארד פרמטרים שרצה מקומית על מחשבי אפל סיליקון. מקבלים חלון הקשר ענק בלי לשלם על כל קריאה לשירות ענן.

  • 21Bפרמטרים
  • 131,072טוקנים בהקשר
  • 11.3 GBמשקל הקבצים
  • 299,483הורדות בחודש

מה זה

הפרויקט הזה לוקח את המודל gpt-oss-20b של openai וממיר אותו לעבודה ישירה בספריית mlx. המודל בנוי על ארכיטקטורת GptOssForCausalLM עם 24 שכבות, ומיועד למשימות יצירת טקסט. גודל הקבצים הכולל עומד על 11.3 גיגה בייט שמחולקים ל־12 קבצים נפרדים, מה שמקל על ההורדה והטעינה בסביבות מבוססות אפל.

הנתון הבולט כאן הוא חלון הקשר של 131,072 טוקנים. זה נפח עצום שמאפשר לטעון פנימה קבצי קוד שלמים, מסמכים ארוכים או תמלולים מלאים בבת אחת, בלי לקטוע את השיחה או לנהל חלוקה מורכבת לחלקים קטנים.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון של 131,072 טוקנים מאפשר לקרוא חוזים או דוחות שלמים בבת אחת בלי לחתוך טקסט.

  • עבודה עם פרויקטי קוד

    אפשר לטעון מספר קבצים במקביל לקבלת מענה על תלויות במבנה התוכנה.

  • הרצה מקומית ומאובטחת

    טעינה ישירה דרך mlx שומרת את כל המידע הרגיש בתוך המחשב בלי לשלוח שום דבר לרשת.

איפה זה נופל

דף המודל לא מציג מבחני ביצועים, ציונים או השוואות לאיכות הפלט המקורית אחרי ההמרה. לא ידוע איך המודל מתמודד עם שפות שאינן אנגלית, כולל עברית, ואין שום מידע על נטייה להזיות או דיוק עובדתי. לפני שמחברים אותו למערכת פעילה, חובה לבדוק ידנית איך הוא מגיב לשאילתות אמיתיות ולוודא שהכיווץ לא פגע ביכולת ההסקה שלו במשימות מורכבות.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על לינוקס או ווינדוס עם כרטיס של אנבידיה?

לא. הקבצים האלה הומרו ספציפית עבור ספריית mlx, שמיועדת למעבדי אפל סיליקון בלבד. למערכות אחרות צריך לחפש את המודל המקורי בפורמט שמתאים לספריות כמו transformers.

האם הדגם תומך בשיחה עם תבנית צ'אט?

כן, קוד הדוגמה הרשמי בודק אם קיים chat_template בטוקנייזר ומפעיל אותו על הודעות המשתמש לפני היצירה.

איך מריצים

כדי להריץ אותו מתקינים את ספריית mlx-lm בגרסה 0.27.0 ומעלה, וטוענים את המשקלים ישירות דרך פייתון. המודל תופס קצת יותר מאחד עשר גיגה בייט של אחסון, אבל כדי להחזיק אותו בזיכרון המשותף יחד עם הקשר ארוך תצטרכו מחשב מק עם כמות זיכרון שגדולה בהרבה ממשקל הקבצים עצמם.

אם אתם עובדים על מחשב אישי רגיל בלי שבב של אפל, ההפצה הזו בכלל לא מיועדת לכם. במצב כזה, או אם אין לכם מספיק זיכרון להחזיק הקשר מלא, עדיף להשתמש בנקודת קצה מרוחקת או בשירותי ענן שמגישים את המודל המקורי.

pip install -U huggingface_hub
hf download mlx-community/gpt-oss-20b-MXFP4-Q8

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני מאוד. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗