GPT
G

GigaChat3-10B-A1.8B

קוד פתוח

ai-sagemit2025-11-19

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • moe

ארכיטקטורת מומחים עם עשרה מיליארד פרמטרים שמתנהגת במהירות של מודל קטן. הוא נבנה לעיבוד מהיר במיוחד של טקסטים ברוסית ובאנגלית.

  • 11Bפרמטרים
  • 262,144טוקנים בהקשר
  • 11.4 GBמשקל הקבצים
  • 13,198הורדות בחודש

מה זה

מדובר במודל מבוסס תערובת מומחים שמחזיק מעל 11 מיליארד פרמטרים בסך הכל, אך מפעיל רק 1.8 מיליארד בכל צעד חישוב. המפתחים אימנו אותו על 20 טריליון טוקנים, מתוכם כרבע נתונים סינתטיים, והוסיפו מנגנוני דחיסת זיכרון וחיזוי מרובה טוקנים כדי להאיץ את מהירות הפליטה בעד 40 אחוזים בהשוואה לייצור סדרתי רגיל.

במבחני ביצועים בשפה הרוסית הוא עוקף מודלים צפופים בגודל של עד 4 מיליארד פרמטרים, עם ציון של 0.6833 במבחן הבנת שפה כללית לעומת פחות מ־0.6 אצל המתחרים. באנגלית הוא מציג תוצאות טובות בידע כללי, אך במשימות חשיבה מורכבות, מתמטיקה וכתיבת קוד הוא מפסיד למודלים קטנים ממנו כמו קוון, מה שמגדיר אותו כפתרון שמתעדף תפוקה מהירה של מלל על פני היגיון כבד.

מתאים ל

  • בוטים מהירים ברוסית

    הוא מציג ציונים גבוהים בשפה הרוסית וקצב פליטה גבוה שמתאים לשיחות בזמן אמת.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 262 אלף טוקנים יחד עם דחיסת זיכרון מאפשרים סריקת טקסטים כבדים ביעילות.

  • שרתי הסקה מוגבלי חומרה

    הפעלת 1.8 מיליארד פרמטרים אקטיביים חוסכת משאבי חישוב ומאפשרת תפוקת טוקנים חריגה למעבד יחיד.

איפה זה נופל

החולשה העיקרית היא חשיבה לוגית וכתיבת קוד. במבחן הקוד LiveCodeBench הוא קיבל תוצאה נמוכה של 0.2031, ובמבחן המתמטיקה MATH500 השיג 0.7000 לעומת 0.8880 במודלים מקבילים. המודל מתמקד בשפות רוסית ואנגלית, ואינו כולל תמיכה מתועדת בעברית. בנוסף, מימוש הפעלת כלים וקריאות פונקציה מחייב גרסאות פיתוח ספציפיות מאוד של שרתי ההסקה, מה שעלול לייצר תקלות יציבות במערכות ייצור.

שאלות
נפוצות

האם המודל תומך בעברית בצורה שוטפת?

התיעוד הרשמי מציין רוסית, אנגלית ועוד כעשר שפות נבחרות ללא אזכור של עברית. לא מומלץ להסתמך עליו למשימות בעברית ללא אימון נוסף ובדיקה מוקדמת.

למה vLLM דורש משתנה סביבה ייעודי להרצה?

קיימת התנגשות טכנית בין ספריית DeepGemm לגודל השכבות הנסתרות במודל הזה. הפעלת הפקודה דורשת כיבוי מפורש של הספרייה דרך משתנה הסביבה כדי למנוע קריסה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־11.4 גיגה־בייט, כך שכרטיס מסך בודד עם 16 או 24 גיגה־בייט של זיכרון יספיק להרצה מקומית. אפשר להעלות אותו ישירות דרך ספריית טרנספורמרס, אך כדי לנצל את מהירות החישוב עדיף להרים שרת באמצעות vLLM או SGLang שתומכים בחיזוי מרובה טוקנים. בבדיקות של המפתחים עם גודל אצווה בודד המודל הפיק מעל 330 טוקנים לשנייה במצב ייעודי, קצב שמזכיר מודלים זעירים של פחות משני מיליארד פרמטרים.

עם זאת, הרצה דרך vLLM דורשת השבתה ידנית של מנגנון DeepGemm בגלל התנגשות בגודל השכבות הפנימיות. אם אין לכם חומרה ייעודית או סבלנות לקנפג ספריות הרצה מותאמות, פנייה לשירותי ענן קיימים תחסוך את כאב הראש הטכני של התאמת הפרמטרים.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai-sage/GigaChat3-10B-A1.8B")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי קוד, הפצה מחדש והטמעה בכל מוצר סגור או פתוח, כשהדרישה היחידה היא שמירה על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗