GPT
G

granite-3.3-2b-instruct

קוד פתוח

ibm-graniteapache-2.02025-04-09

  • transformers
  • safetensors
  • granite
  • text-generation
  • language

מודל קטן של 2.5 מיליארד פרמטרים שמציע חלון הקשר של 128K ותהליכי חשיבה מובנים. הוא מתאים למי שחייב להריץ הכל מקומית על לפטופ רגיל בלי לשלם על שרתים יקרים.

  • 2.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 4.7 GBמשקל הקבצים
  • 44,304הורדות בחודש

מה זה

מדובר במודל שפותח בידי יבמ ומכוון למשימות שיחה, קוד והוראות מורכבות תוך שימוש בתגיות חשיבה ייעודיות שמפרידות בין החשיבה הפנימית לפלט הסופי. הדגש העיקרי כאן הוא הכנסת יכולות עיבוד של מסמכים ארוכים לתוך משקל של 4.7 גיגה בייט בלבד.

במבחני הביצועים הוא עוקף את הדורות הקודמים שלו, כמו גרסה 3.2, במיוחד במעקב אחר הנחיות ובמתמטיקה עם ציון של 72.48 ב־GSM8K לעומת 67.02. במדד AlpacaEval-2.0 הוא מגיע ל־43.45 נקודות כשתכונת החשיבה מופעלת, שזה ניקוד גבוה משמעותית ממודלים גדולים ממנו כמו לאמה 3.1 של 8 מיליארד פרמטרים שנעצר על 27.22.

מתאים ל

  • סיכום מסמכים ארוכים

    חלון של 128K מאפשר לקרוא דוחות טכניים או פרוטוקולים שלמים ישירות על מכונה מקומית.

  • עוזר קוד מקומי בלפטופ

    עם ציון 80.51 ב־HumanEval הוא פותר בעיות פיתוח שגרתיות בלי לשלוח שורות קוד לענן.

  • רכיב ניתוב ופונקציות

    משקלו הקל ותמיכתו בחילוץ טקסט והפעלת פונקציות הופכים אותו למנוע החלטות מהיר במערכות סוכן.

איפה זה נופל

החולשה המרכזית היא עברית. רשימת השפות הנתמכות כוללת 12 שפות בלבד, כמו אנגלית, ערבית, ספרדית וצרפתית, אך עברית נותרה בחוץ ומחייבת אימון נוסף. בנוסף, המודל חלש מאוד בידע כללי ושליפת עובדות, עם תוצאה נמוכה של 18.4 בלבד במבחן PopQA וציון של 44.33 ב־DROP. אם תסתמכו עליו כמקור ידע עצמאי הוא יטעה, ולכן עבודה איתו דורשת הצמדה למקורות מידע חיצוניים.

אותה משפחה

granite-3.3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית ישר מהקופסה?

רשימת 12 השפות הרשמיות לא כוללת עברית, למרות שיש תמיכה בערבית. אפשר לנסות לתשאל אותו בעברית אך התוצאות יהיו מוגבלות מאוד, ומי שרוצה עברית תקינה יצטרך לאמן אותו ייעודית.

מה נותן מנגנון החשיבה הייעודי?

הפעלת מצב חשיבה גורמת למודל לפלוט את שלבי הניתוח שלו בתוך תגיות ייעודיות לפני התשובה הסופית. המהלך הזה מעלה באופן מוכח את הדיוק במשימות היגיון ומתמטיקה, אך מאריך את זמן ההפקה הכולל.

האם הוא יכול להחליף מודלים של 8 מיליארד פרמטרים?

במשימות של מעקב אחר הוראות ופתרון בעיות לוגיות הוא מנצח חלק מהם בזכות מצב החשיבה. יחד עם זאת, בידע כללי ובשאלות טריוויה הנפח הקטן מגביל אותו והוא מפסיד למודלים גדולים.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.7 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון מריץ אותו בלי מאמץ מיוחד דרך ספריית transformers. אם אין לכם מעבד גרפי ייעודי, הוא יכול לעבוד סביר גם על זיכרון של מעבד רגיל.

אם אתם מתכננים להזין לו בקביעות טקסטים שמתקרבים לקצה של 128 אלף הטוקנים, דרישות הזיכרון לניהול ההקשר יקפצו במהירות. במצב כזה, או כשרוצים מענה מיידי בעומס משתמשים גבוה, כדאי לשקול קריאה לשרת חיצוני במקום לחנוק את החומרה המקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-3.3-2b-instruct")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו כחלק ממוצר סגור ולהטמיע אותו במערכות פנימיות בלי תשלום תמלוגים. התנאי המרכזי דורש רק לשמור על הודעות זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗