GPT
G

granite-3.2-8b-instruct

קוד פתוח

ibm-graniteapache-2.02025-02-17

  • transformers
  • safetensors
  • granite
  • text-generation
  • language

גרסת שמונה מיליארד פרמטרים מבית יבמ שמציעה חשיבה נשלטת לפי דרישה. מתאימה למי שצריך מודל קומפקטי עם חלון הקשר ענק של 128 אלף טוקנים ורישיון חופשי.

  • 8.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.2 GBמשקל הקבצים
  • 8,675הורדות בחודש

מה זה

מדובר במודל הוראות שמבוסס על הדור הקודם בסדרה, עם כוונון מיוחד למשימות היגיון וחשיבה. הייחוד המרכזי כאן הוא היכולת להדליק או לכבות את מנגנון ה־thinking ישירות מהטוקנייזר. כשמפעילים אותו, המודל מייצר שרשרת מחשבה לפני שהוא עונה, וכשמכבים, מקבלים תשובה ישירה וחוסכים בזמן ובטוקנים. המודל אומן על שילוב של דאטה חופשי ודאטה סינתטי ייעודי שפותח ביבמ.

במבחני הביצועים, השינוי הזה מתבטא ישירות בציונים של מדדי מענה והיגיון. ב־ArenaHard הוא מזנק ל־55.25 לעומת 37.58 בגרסה 3.1, וב־Alpaca-Eval-2 הוא מגיע ל־61.19 בהשוואה ל־30.34 של קודמו, פער עצום שמציב אותו מעל שאר דגמי השמונה מיליארד שנבדקו מולו. לעומת זאת, במבחני ידע כללי ומבחנים מתמטיים טהורים כמו MMLU או GSM8K, הוא נשאר כמעט באותה רמה ואף מעט נמוך מ־Qwen 2.5 המקביל.

מתאים ל

  • סיכום מסמכים ארגוניים

    חלון של 131,072 טוקנים מאפשר להזין פרוטוקולים ומסמכים ארוכים בניתוח מקומי ומאובטח.

  • פתרון בעיות לוגיות בקוד

    מנגנון החשיבה המובנה מסייע למודל לפרק בעיות שלב אחרי שלב לפני הפליטה הסופית.

  • עוזרים אוטונומיים ו־RAG

    הוא אומן לתמיכה ב־Function Calling ושליפת מידע במערכות מרובות שפות נתמכות.

איפה זה נופל

החיסרון המרכזי שנובע מהחומר הוא היעדר תמיכה רשמית בעברית. רשימת השפות הנתמכות מונה שתים־עשרה שפות בלבד, כולל אנגלית, ערבית, צרפתית וגרמנית, אך עברית אינה מופיעה בהן. אם תנסו לעבוד איתו בעברית תצטרכו לאמן אותו בעצמכם או לבדוק היטב איך הוא מתמודד עם השפה.

מעבר לזה, במבחני ידע קלאסיים כמו MMLU הוא קיבל 66.79, ציון שנמוך משמעותית ממתחרה כמו Qwen 2.5 7B שמגיע ל־74.30. גם במבחן BigBenchHard הוא מציג ירידה קלה לעומת הגרסה הקודמת.

אותה משפחה

granite-3.2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

הכרטיס מפרט תמיכה ב־12 שפות ספציפיות ועברית לא ביניהן. ייתכן שהוא יבין מילים מסוימות, אבל בשביל שימוש אמיתי במוצר תצטרכו לבצע פיין־טיונינג עצמאי.

מה המשמעות של מתג החשיבה בקוד?

אפשר להגדיר בטוקנייזר thinking=True עבור שאלות מורכבות שמצריכות היגיון, או לכבות אותו כדי לקבל תשובה מהירה וקצרה בלי לבזבז כוח חישוב.

האם אפשר להשתמש בו ישירות באפליקציה מסחרית?

כן. רישיון apache-2.0 מאפשר שימוש מסחרי מלא, כולל הטמעה במוצרים פנימיים או חיצוניים, בתנאי שמשאירים את הקרדיט המקורי.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.2 גיגה־בייט בפורמט bfloat16. כדי לטעון אותו כמו שהוא לזיכרון כרטיס המסך תצטרכו לפחות 16 גיגה־בייט VRAM, למשל כרטיס RTX 4080, וזה עוד לפני שלוקחים בחשבון את המקום לתשובות ארוכות. אם אתם מתכננים לנצל חלק משמעותי מחלון ההקשר המלא, שמגיע ל־131,072 טוקנים, כרטיס בודד כזה כבר לא יספיק בגלל ה־KV Cache ותצטרכו כרטיסים מקצועיים או חלוקה לכמה מעבדים.

הריצה נעשית דרך ספריית transformers הפשוטה של פייתון. אם אתם צריכים רק שאילתות מדי פעם או שאין לכם שרת ייעודי, הקמה מקומית תהיה יקרה מדי לעומת צריכה דרך ספק ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-3.2-8b-instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים, בלי חובת תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗