GPT
G

gpt-oss-120b-GGUF

קוד פתוח

ggml-orgapache-2.02025-08-02

  • gguf
  • quantized
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF שנועדה לאפשר הרצה מקומית של מודל ענק עם 120 מיליארד פרמטרים. היא פונה למי שמחפש יכולות ייצור טקסט מתקדמות בלי תלות בשרתי ענן חיצוניים.

  • 61.3 GBמשקל הקבצים
  • 195,720הורדות בחודש
  • 76לייקים

מה זה

מדובר בהמרה אוטומטית שביצע הארגון ggml-org למודל מבוסס 120 מיליארד פרמטרים, כשהמטרה העיקרית שלו היא text-generation. המקורות שמצוינים בדף הם מודלים של OpenAI ושל Nvidia, כך שהוא מביא ארכיטקטורה רחבה מאוד לקבצים שמותאמים ישירות לתשתית llama.cpp.

דף המודל דל בפרטים ולא כולל מבחני ביצועים או תוצאות מדידה מספריות, ולכן קשה לדעת בדיוק איך הוא מתנהג ביחס למודלים פתוחים אחרים בגודל הזה. עם זאת, עצם העובדה שהוא נשען על מקורות אלה מעידה על ניסיון לתת מענה למשימות כתיבה ועיבוד שפה מורכבות ברמה גבוהה.

ההבדל המשמעותי לעומת המקור הוא אופן האריזה. במקום להיאבק במשקלים המקוריים בסביבות פיתוח כבדות, מקבלים מבנה שמיועד לטעינה נוחה בכלים מקומיים, גם אם מדובר במפלצת של עשרות גיגה-בייט שמחייבת התארגנות מוקדמת.

מתאים ל

  • הקמת שרת טקסט פנימי

    הוא מיועד להרצה מקומית באמצעות llama serve כשרוצים מנוע שפה גדול שלא תלוי ברשת חיצונית.

  • ניסויי שפה על חומרה חזקה

    הוא מתאים למחקר ובדיקות ביצועים של מודלי ענק בסביבת llama.cpp ייעודית.

  • שילוב במוצר מסחרי מקומי

    רישיון apache-2.0 מאפשר להטמיע אותו בתוך מערכות ארגוניות סגורות בלי לפתוח את הקוד שלכם.

איפה זה נופל

כרטיס המודל ריק כמעט לחלוטין ומכיל תזכורת פנימית להוסיף מידע, מה שאומר שאין שום תיעוד רשמי לגבי הטיות, הזיות או חולשות ספציפיות. ההמרה נעשתה בצורה אוטומטית לחלוטין באמצעות סקריפט, כך שלא ברור אם בוצעו בדיקות איכות ידניות אחרי התהליך. לפני שמשלבים אותו במערכת אמיתית, חובה לבדוק בעצמכם איך הוא מתמודד עם השפה הרצויה, עד כמה הוא עקבי בהוראות ארוכות, והאם הפלט שלו בכלל יציב.

אותה משפחה

gpt-oss יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

הכרטיס לא מציין אילו שפות נתמכות ובאיזו רמה, ואין שום מידע על נתוני האימון שלו. אם עברית היא חלק מהדרישות שלכם, תצטרכו להוריד אותו ולבדוק בעצמכם את איכות הפלט.

האם אפשר להריץ אותו על מחשב אישי רגיל?

לא, המשקל הכולל מגיע ל־61.3 גיגה-בייט. תצטרכו מחשב חזק במיוחד עם כמות חריגה של זיכרון עבודה או שרת ייעודי כדי לטעון אותו.

איך מריצים

כדי לעבוד איתו אפשר להריץ פקודה פשוטה של llama serve ישירות מול Hugging Face דרך התשתית של llama.app. המודל שוקל 61.3 גיגה-בייט ומחולק לשבעה קבצים, מה שאומר שאין מה לנסות להרים אותו על מחשב נייד ממוצע או כרטיס מסך בודד של משתמש ביתי.

תצטרכו שרת ייעודי עם זיכרון RAM נרחב או מערך כרטיסי מסך חזקים כדי להחזיק את כל המשקל הזה בזיכרון בלי להיתקע. אם אין לכם חומרה כזאת זמינה במשרד, עדיף לקרוא ל־API חיצוני במקום להשקיע אלפי שקלים בהקמת תשתית עצמאית.

ollama run hf.co/ggml-org/gpt-oss-120b-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

7 קבצים במאגר, 61.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא apache-2.0, וזה אומר חופש פעולה רחב מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאים העיקריים הם שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי דרישה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗