GPT
G

granite-4.0-h-micro

קוד פתוח

ibm-graniteapache-2.02025-09-16

  • transformers
  • safetensors
  • granitemoehybrid
  • text-generation
  • language

מודל של 3.2 מיליארד פרמטרים מבית IBM עם חלון הקשר עצום של 128 אלף טוקנים. מתאים למי שחייב לעבד מסמכים ארוכים או להפעיל פונקציות מקומית בחומרה צנועה.

  • 3.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.0 GBמשקל הקבצים
  • 11,069הורדות בחודש

מה זה

מדובר במודל הוראות קומפקטי שמכוון בדיוק למשימות ארגוניות יומיומיות: תמצות, חילוץ מידע, עבודה בתצורת RAG והפעלת פונקציות לפי הסכמה של OpenAI. למרות הגודל הקטן שלו, IBM דחפו לכאן חלון הקשר מלא של 131,072 טוקנים, מה שמאפשר להזין לו מסמכים שלמים בלי לחתוך אותם מראש לחתיכות קטנות.

במבחני הביצועים הוא מציג תמונה מעניינת. במעקב אחרי הוראות מורכבות הוא מקבל ציון ממוצע של 84.32 ב־IFEval, ובכתיבת קוד פשוט הוא מגיע ל־81 ב־HumanEval. עם זאת, במשימות היגיון ופתרון בעיות מעמיק יותר הוא מוגבל מאוד, עם 43.48 בלבד ב־MMLU-Pro ו־32.15 ב־GPQA. כלומר, הוא יודע לציית להנחיות ולטפל בטקסט קיים, אבל לא הייתי בונה עליו לחשיבה אנליטית מורכבת.

מתאים ל

  • סוכן להפעלת פונקציות מקומי

    הוא קטן מספיק כדי לרוץ מקומית ותומך בסכמת פונקציות מובנית, כך שאפשר לחבר אותו ל־APIs פשוטים בלי לשלם על טוקנים.

  • תמצות וחילוץ ממסמכים ארוכים

    חלון של 128 אלף טוקנים במודל קל מאפשר לקרוא חוזים או לוגים באנגלית בלי להסתבך עם פיצול טקסטים.

  • מערכות RAG באנגלית וערבית

    בזכות ציון גבוה יחסית במעקב אחר הוראות, הוא שולף ומסכם מידע מתוך קטעי טקסט רלוונטיים באמינות טובה.

איפה זה נופל

החיסרון הברור ביותר לישראלים הוא השפות. רשימת השפות הנתמכות כוללת אנגלית, ערבית, גרמנית, צרפתית, ספרדית ועוד כמה, אבל עברית פשוט לא קיימת שם. אם תנסו לעבד איתו טקסטים בעברית תצטרכו לאמן אותו קודם בעצמכם, אחרת התוצאות יהיו חלשות.

בנוסף, במבחן הפעלת הכלים BFCL v3 הוא השיג רק 57.56. זה אומר שבכמעט חצי מהמקרים הוא עלול לפספס את הקריאה הנכונה ל־API או לטעות במבנה הפרמטרים, ולכן חובה להוסיף שכבת ולידציה קשיחה בקוד לפני שמריצים פקודות על סמך הפלט שלו.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם טקסטים בעברית?

לא. עברית לא מופיעה ברשימת השפות הרשמית ש־IBM תמכו בהן. הוא יתקשה מאוד להבין ולייצר טקסט עברי תקין, אלא אם תבצעו לו finetuning ייעודי.

איזה כרטיס מסך צריך כדי להריץ אותו?

בשביל הרצה רגילה עם הקשר קצר עד בינוני, כרטיס מסך של 8 עד 12 גיגה זיכרון מספיק לגמרי. אם תרצו לנצל את כל 128 אלף הטוקנים, תצטרכו משמעותית יותר זיכרון בגלל משקל ההקשר.

איך מריצים

המשקל הכולל של הקבצים עומד על 6 גיגה בייט בדיוק של bfloat16. זה אומר שכרטיס מסך ביתי בודד עם 8 עד 12 גיגה בייט זיכרון יריץ אותו בקלות דרך ספריית transformers, אפילו בלי צורך בכימות אגרסיבי.

הבעיה מתחילה ברגע שמנסים לנצל את כל 128 אלף הטוקנים של ההקשר. במצב כזה צריכת הזיכרון של ה־KV cache מזנקת, והחומרה הביתית תיחנק מהר מאוד. אם השימוש שלכם כולל עיבוד קבוע של מסמכי ענק מקצה לקצה, החזקה של שרת ייעודי רק בשביל מודל 3B כזה תהיה יקרה ומיותרת, ועדיף להשתמש ב־API מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-4.0-h-micro")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לאמן אותו מחדש, לשלב אותו בתוך מוצר סגור ולהפיץ אותו ללקוחות. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗