GPT
G

GigaChat-20B-A3B-instruct

קוד פתוח

ai-sagemit2024-12-13

  • transformers
  • safetensors
  • deepseek
  • text-generation
  • conversational

מודל שיחה עם 21B פרמטרים שמתמקד ברוסית ובאנגלית, עם חלון של 131,072 טוקנים. הוא פונה למי שצריך עיבוד טקסטים ארוכים במיוחד בשפות האלה תחת רישיון פתוח.

  • 21Bפרמטרים
  • 131,072טוקנים בהקשר
  • 76.7 GBמשקל הקבצים
  • 1,216הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת DeepseekForCausalLM שפותח עבור שיחה ומענה להוראות, ומגיע עם תמיכה מוצהרת בשתי שפות בלבד: רוסית ואנגלית. גולת הכותרת כאן היא שילוב של 20,589,299,712 פרמטרים עם חלון הקשר נדיב שמגיע ל־131,072 טוקנים, מה שמאפשר להזין מסמכים שלמים מבלי לקטוע אותם.

במבחני ביצועים ברוסית המודל מציג יתרון מול דגמים כמו gemma-2-9b-it במדד MERA שבו קיבל 0.513 לעומת 0.392, ובמבחן Shlepa עם 0.482 לעומת 0.388, אך במבחן ru-MMLU 5-shot הוא קיבל 0.598 ופיגר אחרי 0.625 של גמא. בהשוואה למודלים הגדולים מאותה משפחה, Pro ו־Max, התוצאות שלו נמוכות באופן עקבי בכל המדדים שנבדקו, כולל ידע כללי, מתמטיקה ומטלות תכנות.

מתאים ל

  • ניתוח מסמכים ברוסית

    חלון של 131,072 טוקנים יחד עם תוצאה של 0.513 ב־MERA מתאימים לקריאה ומענה על טקסטים ארוכים ברוסית.

  • פתרון בעיות מתמטיות

    המודל השיג ציון של 0,763 ב־GSM8K, מה שמעיד על יכולת סבירה בחישובי מספרים לפי דוגמאות.

  • שירות שיחה מקומי ברישיון חופשי

    רישיון mit מלא מאפשר פריסה עצמאית בשרתי הארגון בלי לחשוף נתונים לספק חיצוני.

איפה זה נופל

החיסרון המרכזי למשתמש בארץ הוא היעדר מוחלט של תמיכה רשמית בעברית, שכן המודל אומן ונבדק רק על רוסית ואנגלית. בנוסף, יכולות הקוד שלו חלשות יחסית למשפחה, עם ציון של 0,329 ב־HumanEval וציון 0,385 ב־MBPP. הוא גם מתקשה בדיוק מול הנחיות מורכבות, כפי שמעיד ציון של 0,411 בלבד במבחן IFEval. הרצה שלו מחייבת הרצת קוד צד שלישי לא מוכר בגלל מבנה המודל, דבר שמייצר סיכון אבטחה שדורש בדיקה לפני שילוב בסביבה פנימית.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הכרטיס מצהיר על תמיכה בשפות ru ו־en בלבד, כך שעברית כלל לא נכללת ביכולות המוצהרות שלו. לא כדאי לבנות עליו למשימות בעברית ללא אימון והתאמה נפרדים.

האם צריך להוריד את כל קובצי ה־float32?

המשקל המלא הוא 76.7 GB, אבל קיימות גרסאות קלות יותר ב־bf16 וב־int8 שמוזכרות בתיעוד. לרוב השימושים עדיף לקחת אותן כדי לחסוך מקום בזיכרון וזמן הורדה.

איך מריצים

המשקלים במאגר הזה שמורים בדיוק float32 ותופסים 76.7 GB על הדיסק, מה שהופך את ההורדה והטעינה לכבדות מאוד. כדי להריץ אותו מקומית באופן הגיוני, עדיף לפנות לגרסאות ה־bf16 או ה־int8 שהיוצרים פרסמו, או להשתמש בהגדרת bfloat16 דרך transformers או vLLM.

הרצה דרך transformers דורשת גרסה 4.47 ומעלה, ושימוש בפרמטר trust_remote_code שחובה להפעיל גם בטוקנייזר וגם במודל. היוצרים מספקים דוגמת שרת ייעודית עם vLLM ומגבילים בה את האורך ל־8192 טוקנים בפועל, לצד אזהרה להשתמש בהמרת הטוקנים הישירה של תבנית השיחה ולא בשרשור מחרוזות רגיל.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai-sage/GigaChat-20B-A3B-instruct")
print(pipe("שלום"))

הרישיון

הרישיון המדווח הוא mit. מדובר ברישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים, ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗