GPT
G

granite-4.0-h-small

קוד פתוח

ibm-graniteapache-2.02025-09-16

  • transformers
  • safetensors
  • granitemoehybrid
  • text-generation
  • language

גרסה מכווצת בארכיטקטורת תערובת מומחים של IBM שמציעה חלון הקשר ענק והבנה טובה של קוד. מי שבוחר בה מחפש בעיקר מודל פתוח להפעלת פונקציות ואוטומציות בלי לשלם על מודלי ענק.

  • 32Bפרמטרים
  • 131,072טוקנים בהקשר
  • 60.0 GBמשקל הקבצים
  • 24,388הורדות בחודש

מה זה

מדובר במודל הוראות שמבוסס על ארכיטקטורת תערובת מומחים היברידית עם 32 מיליארד פרמטרים. IBM אימנה אותו על שילוב של דאטה פתוח ברישיון מתירני ודאטה סינתטי פנימי, ועברה תהליכי יישור עם למידת חיזוק ומיזוג מודלים. הוא מיועד למשימות ארגוניות נפוצות, החל מתמצות וחילוץ מידע, דרך שיחה רב לשונית, ועד השלמת קוד באמצע קובץ.

במבחנים של IBM הוא מוביל על פני הגרסאות הקטנות יותר בסדרה כמעט בכל תחום. ב־HumanEval הוא מגיע ל־88 אחוז במעבר ראשון, ובמדד IFEval לבדיקת ציות להוראות הוא משיג 89.87 אחוז. במבחן הפעלת כלים הוא מקבל 64.69 נקודות. המספרים האלה מראים שהוא יודע לעקוב אחרי פורמט מוגדר ולא סוטה בקלות מהנחיות, תכונה קריטית למי שבונה סוכנים.

מתאים ל

  • הפעלת פונקציות וכלים

    הוא מותאם למבנה של OpenAI ומשיג ציון טוב בבדיקות הפעלת כלים, מה שמתאים לחיבור מול ממשקי תוכנה.

  • עבודה על בסיס קוד קיים

    יכולת השלמת הקוד באמצע הקובץ וציון גבוה במבחני קוד מתאימים לבניית עזרי פיתוח פנימיים.

  • סריקת מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין תיעוד טכני נרחב או חוזים לצורך תמצות ושליפת נתונים.

איפה זה נופל

הכרטיס מפרט רשימת שפות נתמכות שכוללת אנגלית, ערבית, גרמנית, צרפתית, ספרדית ועוד כמה, אבל עברית לא מופיעה שם. אם המוצר שלכם פונה לקהל ישראלי, תצטרכו לאמן אותו בעצמכם על דאטה מקומי או לוותר עליו למשימות שדורשות עברית טבעית. חיסרון נוסף שרואים במבחנים הוא ירידה ביכולת במתמטיקה רב לשונית, שם הוא קיבל 38.72 בלבד במבחן MGSM, תוצאה נמוכה יותר מהגרסאות הקטנות ממנו בסדרה.

אותה משפחה

granite-4.0-h-small יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות בעברית?

עברית לא נכללת ברשימת השפות הרשמית שהוגדרה על ידי IBM. אפשר לנסות להזין לו עברית, אבל הביצועים יהיו לא יציבים ועדיף לא להסתמך עליו למשימות בשפה הזו בלי אימון מוקדם.

איזה כרטיס מסך נדרש כדי להעלות אותו?

המשקלים לבדם שוקלים 60 ג׳יגה בייט בפורמט המקורי. תצטרכו כרטיס מקצועי עם 80 ג׳יגה זיכרון כמו A100 או H100, במיוחד אם תרצו לנצל את חלון ההקשר המלא.

איך מריצים

כדי להריץ אותו צריך להוריד 60 ג׳יגה בייט של משקלים בפורמט bfloat16. זה אומר שחומרה ביתית רגילה לא תספיק, ואתם צריכים לפחות כרטיס שרת מקצועי עם 80 ג׳יגה זיכרון גרפי, או מערך של שני כרטיסים של 48 ג׳יגה, עוד לפני שמחשבים את הזיכרון הנדרש להקשר ארוך.

ההרצה עצמה מתבצעת ישירות דרך ספריית transformers ו־accelerate בתוך סביבת פייתון עם פייטורץ׳. אם אתם לא מחזיקים שרתים ייעודיים לעיבוד כזה, עדיף לצרוך אותו דרך ספק ענן או API, אחרת תשלמו הרבה על שרת רק כדי להחזיק את המודל בזיכרון בלי ניצול מלא שלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-4.0-h-small")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗