GPT
G

granite-4.0-h-small-GGUF

קוד פתוח

unslothapache-2.02025-10-01

  • transformers
  • gguf
  • language
  • unsloth
  • granite-4.0

גרסת GGUF ששחררו Unsloth למודל ההוראות של IBM עם 32 מיליארד פרמטרים. הוא מיועד למי שמחפש ריצה מקומית של מודל חזק במיוחד במעקב אחר פקודות וקריאות לפונקציות.

  • 500 GBמשקל הקבצים
  • 4,009הורדות בחודש
  • 47לייקים

מה זה

מדובר במודל שפותח במקור על ידי יבמ ועבר המרה למבנה GGUF על ידי צוות Unsloth. הבסיס שלו מכיל 32 מיליארד פרמטרים, בארכיטקטורת MoE שמכוונת למשימות עסקיות, ומאומן על שילוב של דאטה חופשי וסינתטי עם יישור התנהגותי בעזרת למידת חיזוק ומיזוג מודלים.

במבחני הביצועים הוא מציג תוצאות גבוהות יחסית לגודל שלו. ב־IFEval המחמיר הוא מגיע ל־89.87, מה שמעיד על היצמדות קפדנית להוראות בפורמט מובנה, וב־HumanEval הוא מציג 88 נקודות. במבחן הקריאה לכלים BFCL v3 הוא מקבל ציון של 64.69, שזה הבדל מורגש מול הגרסאות הקטנות יותר במשפחה.

מתאים ל

  • אינטגרציה עם מערכות ו־APIs

    תוצאה של 64.69 במבחן BFCL הופכת אותו למתאים לקריאת פונקציות וחיבור למאגרי מידע.

  • השלמת קוד ופיתוח

    ציון של 88 ב־HumanEval ותמיכה ב־FIM מאפשרים לו לייצר קוד בצורה מדויקת.

  • עיבוד טקסטים עסקיים באנגלית

    מעקב ההוראות הקפדני שלו ב־IFEval מבטיח עמידה במבני פלט מוגדרים מראש ללא סטיות.

איפה זה נופל

הבעיה המיידית למפתחים בישראל היא רשימת השפות הנתמכות. יבמ הגדירו תמיכה ב־12 שפות ספציפיות שכוללות אנגלית, גרמנית, ערבית וספרדית, אבל עברית לא מופיעה שם כלל. אם תנסו לעבוד איתו בעברית בלי אימון מקדים, התוצאות צפויות להיות מקרטעות.

בנוסף, במבחן המתמטי הרב־לשוני MGSM המודל קיבל ציון חלש של 38.72, נמוך משמעותית אפילו מגרסת ה־Tiny של אותה סדרה. משימות חישוב בשפות שאינן אנגלית דורשות בדיקה מחמירה לפני שסומכים עליו.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הכרטיס מפרט תמיכה ב־12 שפות בלבד ועברית לא ביניהן. בשביל עבודה טובה בעברית תצטרכו לבצע לו fine-tuning בעצמכם על דאטה מתאים.

למה המאגר שוקל 500 גיגה בייט?

המאגר כולל 33 קבצים שמכילים רמות דחיסה שונות בפורמט GGUF. בפועל מורידים רק קובץ אחד שמתאים לנפח ה־VRAM שיש במחשב שלכם.

איך מריצים

המשקל הכולל של הקבצים במאגר הזה מגיע ל־500 גיגה בייט בגלל פיצול למגוון קוונטיזציות שונות. אתם לא מורידים את הכל, אלא בוחרים קובץ בודד שמתאים לנפח הזיכרון שלכם, וטוענים אותו בסביבות שתומכות בפורמט או בעזרת הספריות של פייתון כמו transformers ו־accelerate.

בשביל להריץ 32 מיליארד פרמטרים בצורה שמישה תצטרכו כרטיס מסך עם זיכרון משמעותי של 24 גיגה בייט לפחות לקוונטיזציה נמוכה, או שילוב של שני כרטיסים אם אתם מכוונים לדיוק גבוה. אם אין לכם את הברזלים האלה במשרד, הקמה ותחזוקה של שרת כזה תעלה הרבה יותר מפנייה ישירה ל־API חיצוני.

ollama run hf.co/unsloth/granite-4.0-h-small-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר ברישיון אפאצ'י 2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקולות והפצה בתוך מוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗