GPT
G

granite-4.2-30b

קוד פתוח

ibm-graniteapache-2.02026-08-07

  • transformers
  • safetensors
  • granite
  • text-generation
  • granite-4.2

מודל קוד והסקה של IBM עם 29 מיליארד פרמטרים ורישיון חופשי לחלוטין. הוא פותר בעיות מורכבות של קריאות לכלים ופיתוח תוכנה בלי להחזיק משקולות ענק של מאות מיליארדים.

  • 29Bפרמטרים
  • 131,072טוקנים בהקשר
  • 54.5 GBמשקל הקבצים
  • 12,037הורדות בחודש

מה זה

מדובר במודל דחוס יחסית שמתמקד בחשיבה מובנית לפני מתן תשובה. במקום לפלוט טקסט מיד, הוא מנתח את הבעיה בתוך תגיות חשיבה ייעודיות, מה שמקפיץ את הדיוק בלוגיקה ובכתיבת קוד. המודל תומך בחלון בסיס של 131,072 טוקנים, וניתן להגדיר לו את רמת המאמץ המחשבתי או לכבות אותה לגמרי כדי לחסוך זמן.

במדדי ביצועים, ההשקעה באימון המחוזק על סביבות קוד ניכרת. הוא מגיע לציון של 57 במדד SWE Bench Verified וציון של 89.17 במבחני מתמטיקה כמו AIME25. המשמעות היא שהוא מסוגל להבין שגיאות מורכבות במאגרי קוד אמיתיים ולטפל בהפעלת פונקציות ברצף, הרבה מעבר למה שמוכר במודלים פתוחים בגודל 8 מיליארד.

מתאים ל

  • סוכני פיתוח ותיקון באגים

    התוצאה של 57 במדד SWE Bench Verified הופכת אותו למנוע מצוין לכתיבה ובדיקה של קוד בריפו.

  • קריאה לפונקציות וכלים

    שלב החשיבה המובנה מאפשר לו לנתח מראש איזה כלי להפעיל ובאילו פרמטרים בדיוק.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין תיעוד טכני שלם יחד עם היסטוריית שיחה עמוקה.

איפה זה נופל

הכרטיס מפרט רשימת שפות בדוקות שאינה כוללת עברית, כך שתמיכה בעברית אינה מובטחת ודורשת בדיקה עצמאית. בנוסף, מודל חשיבה מייצר כמות גדולה מאוד של טוקנים נסתרים לפני התשובה הסופית. זה גורר השהיה גבוהה מאוד בתשובה הראשונה, מה שלא מתאים לממשקי צ'אט חיים שדורשים מהירות. במשימות מסוימות כמו מעקב הוראות פשוטות ציון ה־IFBench עומד על 77.17, מעט נמוך יותר מגרסת ה־8B של אותה משפחה.

אותה משפחה

granite-4.2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לעקוף את מנגנון החשיבה כדי לקבל תשובה מהירה?

כן. התבנית מאפשרת להגדיר מצב ללא חשיבה, ואז המודל מדלג על תגיות הניתוח ומפיק תשובה ישירה בחלון קצר יותר.

האם המודל מתאים לשימוש בעברית?

המודל לא נבדק רשמית בעברית ברשימת השפות שבדקה IBM. הוא עשוי להבין ולייצר עברית ברמה מסוימת, אבל צריך לבדוק אותו ביסודיות לפני שילוב במוצר שמיועד לדוברי עברית.

למה חובה להשתמש בטמפרטורה 1.0?

צוות הפיתוח אימן את המודל בחיזוקים והגדיר במפורש שטמפרטורה 1.0 עם top_p של 0.95 נדרשת בכל סוגי המשימות, אחרת איכות ההסקה נפגעת.

איך מריצים

כדי להריץ מודל במשקל 54.5 גיגה בייט בדיוק bfloat16, צריך לפחות שני כרטיסי מסך עם 48 גיגה זיכרון, או כרטיס בודד של 80 גיגה דוגמת A100 או H100. אם רוצים לנצל את חלון ההקשר המלא של 128 אלף טוקנים, דרישות הזיכרון ל־KV cache מזנקות עוד יותר.

ההפעלה נעשית עם ספריות כמו vLLM או SGLang, תוך שימוש בפרסרים ייעודיים לתגיות החשיבה וקריאות הכלים. חובה לקבע את הטמפרטורה על 1.0 וערך דגימה של 0.95 לפי הנחיות היצרן. אם אין לכם שרת ייעודי כזה פנוי, עדיף לצרוך אותו דרך ספק ענן או מנוע הרצה חיצוני במקום לקנות חומרה כבדה מראש.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-4.2-30b")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים ברישיון Apache 2.0. זהו רישיון פתוח לחלוטין שמאפשר שימוש מסחרי, שינוי הקוד, אירוח עצמי ושילוב במוצרים סגורים, ללא תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗