GPT
G

unsloth/gpt-oss-20b

קוד פתוח

unslothapache-2.02025-08-05

  • transformers
  • safetensors
  • gpt_oss
  • text-generation
  • vllm

מודל פתוח שרץ מקומית על כרטיסי מסך ביתיים עם שרשרת חשיבה מלאה. הוא מביא יכולות של סוכנים אוטונומיים והפעלת כלים בחבילה קומפקטית.

  • 22Bפרמטרים
  • 131,072טוקנים בהקשר
  • 25.6 GBמשקל הקבצים
  • 10,768הורדות בחודש

מה זה

מדובר בגרסה הקטנה של סדרת הקוד הפתוח, עם מבנה של מומחים שמפעיל רק 3.6 מיליארד פרמטרים בפועל מתוך 21 מיליארד בכל שלב. הדבר הזה מאפשר לו לעבוד בזמני תגובה נמוכים מאוד ביחס לגודל המלא שלו, בלי להקריב את עומק הבדיקה של הפלט.

הוא מגיע עם יכולת מובנית להריץ קוד פייתון, לגלוש ברשת ולבצע קריאות לפונקציות לפי סכמה, יחד עם חלון הקשר ארוך של 131,072 טוקנים. הייחוד העיקרי הוא האפשרות לשלוט ברמת מאמץ החשיבה, מנמוך לשיחות מהירות ועד גבוה למשימות שמחייבות ניתוח מורכב, תוך חשיפה של תהליך ההסקה המלא לצורכי דיבאג.

מתאים ל

  • סוכנים מבוססי כלים

    הוא כולל תמיכה מובנית בקריאת פונקציות, גלישה והרצת פייתון ישירות מהקופסה.

  • פיתוח ודיבאג של חשיבה

    גישה מלאה לשרשרת ההסקה מאפשרת להבין בדיוק איפה תהליך קבלת ההחלטות נכשל.

  • עבודה מקומית ומאובטחת

    נכנס לתוך 16 גיגה זיכרון ומאפשר ריצה מבודדת בלי להוציא שום מידע החוצה.

איפה זה נופל

יש פה מגבלה קריטית: המודל אומן ספציפית על פורמט התגובות harmony, ובלי שימוש מדויק בפורמט הזה או בטמפלט השיחה של Transformers הוא פשוט לא יעבוד נכון. בנוסף, שרשרת החשיבה המלאה חשופה כברירת מחדל ולא מיועדת להצגה ישירה למשתמשי קצה, מה שמחייב אתכם לסנן אותה באפליקציה.

אותה משפחה

gpt-oss יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אני חייב כרטיס מסך של שרתים כדי להריץ אותו?

לא. בזכות הקוונטיזציה המובנית הוא רץ בתוך 16 גיגה זיכרון וידאו, כך שכרטיס מסך ביתי חזק יספיק לגמרי.

איך שולטים על עומק החשיבה וזמני התגובה?

מגדירים את רמת המאמץ ישירות בתוך הפרומפט של המערכת, עם בחירה בין רמה נמוכה, בינונית או גבוהה בהתאם למשימה.

אפשר להשתמש בו ישירות מול המשתמש בלי תיווך?

עדיף שלא. שרשרת החשיבה שלו גלויה ונועדה לפיתוח ובקרה, כך שתצטרכו לעטוף את הפלט ולבודד את התשובה הסופית לפני הצגתה.

איך מריצים

המודל תופס כ־25.6 גיגה בייט ומאומן בקוונטיזציה מובנית שמאפשרת לו לרוץ בתוך 16 גיגה זיכרון וידאו, מה שאומר שאפשר להעלות אותו על מחשב אישי או שרת צנוע באמצעות Transformers, Ollama, LM Studio או vLLM.

אם אתם צריכים רק שאילתות פשוטות מדי פעם, עדיף להשתמש ב־API מרוחק כדי לא לתפוס משאבי חומרה מקומיים. ההרצה העצמאית משתלמת ברגע שרוצים פרטיות מוחלטת, יכולת לשנות את המשקלים באימון נוסף או שליטה מלאה ברמת החשיבה בלי לשלם לפי קריאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/gpt-oss-20b")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לבצע עליו אימון נוסף ולשלב אותו במוצרים סגורים בלי חובת שיתוף של הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗