GPT
G

granite-3.0-8b-instruct

קוד פתוח

ibm-graniteapache-2.02024-10-02

  • transformers
  • safetensors
  • granite
  • text-generation
  • language

גרסה מכווננת להוראות בגודל שמונה מיליארד פרמטרים שמתאימה לשימוש עסקי. יבמ אימנו אותה בעיקר על דאטה ברישיון פתוח כדי להוריד סיכונים משפטיים.

  • 8.2Bפרמטרים
  • 4,096טוקנים בהקשר
  • 15.2 GBמשקל הקבצים
  • 114,949הורדות בחודש

מה זה

מדובר במודל שפה צפוף שפותח מגרסת הבסיס באמצעות שילוב של אימון מונחה, למידת חיזוק ומיזוג מודלים. הוא מכוון למשימות עבודה מוגדרות היטב כמו תמצות, חילוץ מידע, סיווג טקסט, הפעלת פונקציות וצירוף של שאילתות לקוד. האימון הראשוני שלו התבצע על 12 טריליון טוקנים, נפח עצום לגודל כזה, מה שאמור לתת לו יציבות טובה יותר בתשובות יומיומיות.

ההבדל המרכזי מול מתחרים באותה קטגוריית משקל הוא הדגש על מקורות המידע. יבמ השתמשו במאגרי מידע פתוחים בעלי רישיונות מתירניים לצד דאטה סינתטי שנוצר בתוך החברה, כדי לאפשר שילוב ביישומים ארגוניים בלי כאב ראש של זכויות יוצרים. הוא תומך רשמית ב־12 שפות, כולל אנגלית, ערבית, גרמנית, צרפתית וספרדית.

מתאים ל

  • הפעלת פונקציות וקוד

    המודל אומן ספציפית לתרגום בקשות למבנה קריאה לפונקציות ולמשימות פיתוח מוגדרות.

  • חילוץ וסיווג מידע עסקי

    מתאים לעיבוד טקסטים קצרים וסיווג נתונים פנים ארגוניים ללא חשש מבעיות רישוי.

  • עוזר שיחה בערבית או אנגלית

    תומך ברשימת שפות רשמית שכוללת אנגלית וערבית עבור ממשקי צ׳אט ממוקדים.

איפה זה נופל

המגבלה הטכנית הבולטת ביותר היא חלון הקשר של 4,096 טוקנים בלבד. לתרחישי RAG עמוקים או עיבוד מסמכים ארוכים זה פשוט מעט מדי ומחייב חיתוך אגרסיבי של הטקסט. עברית אינה ברשימת השפות הנתמכות, כך שהבנת השפה המקומית אינה מובטחת ודורשת בדיקה קפדנית. בנוסף, המפתחים מודים שהביצועים בשפות שאינן אנגלית נמוכים יותר, וממליצים להוסיף דוגמאות בתוך הפרומפט כדי לשמור על תוצאות סבירות.

אותה משפחה

granite-3.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

עברית לא נכללת ב־12 השפות הנתמכות רשמית על ידי יבמ. הוא מסוגל לקלוט מילים בודדות, אבל בלי כוונון ייעודי הוא כנראה ייצר שגיאות תחביר והזיות. לשימוש בעברית תידרשו לבצע פיין טיונינג עצמאי.

האם חלון ההקשר מספיק למערכות RAG?

חלון של 4,096 טוקנים מאפשר לשלוח רק פסקאות בודדות יחד עם השאלה וההוראות. אם מסמכי המקור ארוכים, תצטרכו לחתוך אותם למקטעים קטנים מאוד כדי לא לחרוג מהמגבלה.

איך מריצים

בשביל להריץ אותו כמו שהוא בדיוק של bfloat16 תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון גרפי, בהתחשב בכך שמשקל הקבצים עומד על 15.2 גיגה. הספריות הרגילות של פייתון כמו transformers ו־accelerate טוענות אותו בלי התאמות מיוחדות, אך במחשב פיתוח מקומי רגיל עדיף לעבוד עם גרסאות מכווצות או קוונטיזציה כדי לחסוך מקום.

אם אין לכם שרת עם מאיץ ייעודי פנוי כל הזמן, הרצה מקומית של מודל כזה תהיה יקרה ואיטית ביחס לשימוש בשרת מנוהל או קריאות רשת לשירות קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="ibm-granite/granite-3.0-8b-instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקולות, הפצה והטמעה במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗