GPT
G

granite-3.1-8b-instruct

קוד פתוח

ibm-graniteapache-2.02024-12-06

  • transformers
  • safetensors
  • granite
  • text-generation
  • language

גרסת שמונה מיליארד הפרמטרים של יבמ מביאה חלון הקשר ענק של 128K ורישיון מסחרי פתוח לגמרי. היא מיועדת בעיקר למי שצריך מודל קומפקטי למשימות מסמכים ארוכים וקריאות לפונקציות בלי להסתבך עם מגבלות שימוש.

  • 8.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.2 GBמשקל הקבצים
  • 33,698הורדות בחודש

מה זה

מדובר במודל צפוף של 8.2 מיליארד פרמטרים שאומן על 12 טריליון טוקנים, ועבר התאמה ייעודית למשימות הקשר ארוך באמצעות נתונים סינתטיים וכוונון בהוראות. הארכיטקטורה שלו סטנדרטית לעולם הנוכחי, עם ארבעים שכבות ומנגנון Grouped-Query Attention שחוסך זיכרון בזמן ריצה. החוזק המרכזי שלו על הנייר הוא השילוב בין נפח שמתאים לחומרה צנועה יחסית לבין יכולת לקרוא טקסטים בהיקף של ספר שלם.

במבחני הביצועים הוא מוביל בצורה ברורה על פני האחים הקטנים שלו מסדרת גרניט, כמו גרסת השני מיליארד או דגמי ה־MoE, עם ממוצע של 71.31 בלוח התוצאות הישן ו־30.55 בחדש. המבחן החזק שלו הוא IFEval עם ציון של 72.08, מה שמראה שהוא מבין ועוקב טוב אחרי הוראות ומגבלות פלט מורכבות. מצד שני, במבחני חשיבה כבדים כמו GPQA הוא נעצר על 8.28 בלבד, כך שלא מדובר במתמטיקאי גאון אלא בפועל שחור שמבצע הנחיות מוגדרות.

מתאים ל

  • תמצות ישיבות ומסמכים ארוכים

    חלון ה־128K מאפשר להזין פרוטוקולים שלמים באנגלית ולחלץ החלטות ומשימות לפי תבנית קבועה.

  • אוטומציה וקריאות לפונקציות

    התוצאה הגבוהה במעקב אחר הוראות מאפשרת לחבר אותו לסוכני תוכנה וקריאות API מובנות.

  • שליפת מידע RAG ארגוני

    מתאים לשילוב עם בסיסי ידע שדורשים הקשר רחב ברישיון מסחרי נקי שלא כובל את החברה.

איפה זה נופל

החיסרון הכי כואב למפתח ישראלי הוא שפה. המודל תומך רשמית ב־12 שפות בלבד, כולל אנגלית, ערבית, צרפתית וגרמנית, אבל עברית לא נמצאת ברשימה. הכרטיס מודה בעצמו שביצועי שפה שאינה אנגלית נמוכים משמעותית ודורשים few-shot כדי לא להתפזר. חוץ מזה, המודל חלש מאוד במתמטיקה מתקדמת ופתרון בעיות מורכבות, עם 21.68 בלבד ב־MATH Level 5.

אותה משפחה

granite-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יכול לעבוד טוב עם טקסטים בעברית?

לא מומלץ להסתמך עליו בעברית מהקופסה. המודל אומן ותומך ב־12 שפות ספציפיות שעברית אינה ביניהן, והיצרן מבהיר שגם בשפות הנתמכות שאינן אנגלית הביצועים יורדים ודורשים דוגמאות בפרומפט.

מה צריך כדי להריץ אותו עם הקשר מלא של 128K?

המשקלים דורשים כ־16 ג'יגה בייט בזיכרון ה־GPU, אבל הקשר מקסימלי דורש עוד זיכרון משמעותי עבור המטמון. תצטרכו לפחות 32 עד 48 ג'יגה בייט זיכרון וידאו, או לחלופין להשתמש בכימות של 4 ביט.

איך הביצועים שלו במשימות קוד?

הוא מאומן לתמוך במשימות קוד וקריאות לפונקציות, ומצטיין במעקב אחר הנחיות מדויקות, אך היכולת הלוגית שלו בבעיות קצה מוגבלת ביחס למודלים ענקיים.

איך מריצים

המשקלים דורשים 15.2 ג'יגה בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 24 ג'יגה בייט זיכרון, כמו RTX 3090 או RTX 4090, יספיק לטעינה בסיסית. הבעיה מתחילה כשרוצים לנצל את מלוא חלון ההקשר של 128 אלף טוקנים. במצב כזה מטמון ה־KV תופס זיכרון עצום, ואתם תצטרכו לדחוס את המודל ל־int4 או להחזיק כרטיס מקצועי יותר כדי לא לחטוף שגיאת זיכרון.

ההפעלה נעשית ישירות דרך ספריית transformers ודורשת התקנה של torch ו־accelerate. אם כל מה שאתם צריכים זה שאילתות קצרות, להחזיק שרת ייעודי עבורו זה מיותר לגמרי, ומשתלם לקרוא לו דרך ספק צד שלישי רק לפי שימוש.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-3.1-8b-instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו למוצרים מסחריים, לשנות את המשקלים, לאמן עליו הלאה ולמכור גישה אליו בלי לשלם תמלוגים לאף אחד. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗