GPT
G

GigaChat3.1-10B-A1.8B-GGUF

קוד פתוח

ai-sagemit2026-03-21

  • transformers
  • gguf
  • instruct
  • moe
  • multilingual

גרסת GGUF למודל תערובת מומחים קומפקטי עם דגש חזק על רוסית ואנגלית. מיועד למי שמחפש מהירות דגימה גבוהה עם מעט פרמטרים פעילים בזמן ריצה.

  • 44.7 GBמשקל הקבצים
  • 5,452הורדות בחודש
  • 83לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם עשרה מיליארד פרמטרים בסך הכול, כאשר רק 1.8 מיליארד מהם פעילים בכל צעד חישוב. המבנה הזה משלב Multi-head Latent Attention לכיווץ זיכרון ה־KV יחד עם חיזוי של כמה טוקנים במקביל, שנועד לספק תפוקה גבוהה בלי לחנוק את החומרה.

האימון שלו נשען על 5.5 טריליון טוקנים סינתטיים לצד דאטהסטים במתמטיקה, קוד, הנדסה ורפואה. במבחני השוואה ברוסית הוא מציג תוצאות טובות, כמו 0.68 ב־MMLU RU ו־0.6646 ב־RUBQ, ועוקף מודלים כמו Qwen3-4B בביצועים כלליים ברוסית, אם כי במשימות קוד טהורות הוא עדיין מפגר מאחוריו.

מתאים ל

  • בוטים וסוכנים ברוסית

    המודל מכוון במיוחד לעבודה עם קריאות פונקציות ודיאלוגים מורכבים ברוסית שוטפת.

  • הסקה מהירה על שרת בודד

    השילוב של 1.8 מיליארד פרמטרים פעילים עם חיזוי רב-טוקנים נותן קצב דגימה גבוה.

  • חילוץ מידע מדוחות מדעיים

    הוא אומן על טקסטים מורחבים ברפואה, פיזיקה והנדסה יחד עם מענה מבוסס מקורות.

איפה זה נופל

המגבלה הברורה ביותר כאן היא השפות. המודל הוכשר וכוון לעבודה ברוסית ובאנגלית, ואין שום תיעוד או בדיקה ליכולות שלו בעברית, כך שלא כדאי לבנות עליו לעיבוד שפה מקומית.

בנוסף, במבחני תכנות מורכבים כמו Human Eval Plus הוא עומד על 0.7317, לעומת 0.878 שמציג Qwen3-4B-Instruct. גם בבנצ'מרקים קשים של לוגיקה והיגיון דוגמת BBH הוא נעצר ב־0.5758, כך שקיימת נטייה לפספס משימות מורכבות.

שאלות
נפוצות

האם המודל מתאים לפרויקטים בעברית?

התיעוד והאימון של המודל מתמקדים ברוסית ובאנגלית בלבד. לא כדאי להסתמך עליו לפרויקטים שדורשים עברית בלי לבדוק אותו תחילה בצורה מקיפה.

מה צריך כדי להריץ את קבצי ה־GGUF?

יש צורך בהתקנת llama.cpp מגרסה 8495 ומעלה, וקימפול עם תמיכה בכרטיס מסך. ההרצה נעשית דרך llama-server עם דגלים ספציפיים לטעינת השכבות לזיכרון.

איך מריצים

כדי להריץ את גרסת ה־GGUF צריך לקמפל גרסה עדכנית של llama.cpp, החל מגרסה 8495 ומעלה, עם תמיכה ב־CUDA. המאגר מכיל קבצים במשקל כולל של 44.7 ג'יגה בייט בשישה קבצים, כך שצריך כרטיס גרפי עם מספיק VRAM כדי לטעון את השכבות הרצויות.

אם אין לכם חומרה ייעודית עם מאיצים כמו H100 או כרטיסים צרכניים חזקים, החזקת המודל דורשת התעסקות עם הגדרות קימפול, שכבות ל־GPU וגודל הקשר של 32768 טוקנים. במצב כזה, פנייה לשירות ענן מנוהל פשוטה בהרבה.

ollama run hf.co/ai-sage/GigaChat3.1-10B-A1.8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 44.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, להפיץ אותו מחדש ולשלב אותו במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗