GPT
S

sarvam-105b

קוד פתוח

sarvamaiapache-2.02026-03-03

  • transformers
  • safetensors
  • sarvam_mla
  • text-generation
  • conversational

מודל תערובת מומחים של 106 מיליארד פרמטרים שמפעיל רק 10.3 מיליארד בכל טוקן. מתאים למי שמחפש יכולות היגיון וסוכנים חזקות לצד תמיכה רחבה בשפות הודיות.

  • 106Bפרמטרים
  • 131,072טוקנים בהקשר
  • 395 GBמשקל הקבצים
  • 3,672הורדות בחודש

מה זה

מדובר במודל שמשלב ארכיטקטורת MoE עם תשומת לב מסוג MLA, שמכיל 128 מומחים ובוחר שמונה מהם בכל מעבר. המבנה הזה נותן מהירות חישוב של מודל קטן עם מאגר ידע של מודל ענק. הדגש העיקרי כאן הוא משימות חשיבה, מתמטיקה, תכנות ומערכות מבוססות סוכנים, לצד התאמה עמוקה ל־22 שפות הודיות שונות.

במבחני הביצועים הוא מציג מספרים גבוהים מאוד במתמטיקה מורכבת כמו AIME ו־Math500, שם הוא עוקף מודלים מקבילים. הוא גם בולט בגלישה אוטונומית ברשת לפי BrowseComp. מצד שני, במבחני תכנות מעשיים מורכבים כמו SWE Bench Verified הוא נעצר על 45 אחוזים, שזה נמוך יותר ממתחרים ישירים כמו GLM או Qwen. הוא חזק מאוד בהיגיון טהור ובמשימות מוגדרות, אבל מתקשה יותר כשצריך לתקן קוד שלם במערכות קיימות.

מתאים ל

  • סוכני גלישה וחיפוש מידע

    הוא השיג ציון גבוה מאוד במבחן BrowseComp, מה שהופך אותו לבסיס יעיל לאיסוף מידע ומחקר ברשת.

  • מערכות מתמטיקה וחישוב

    ציונים של מעל 88 אחוז ב־AIME ומעל 98 אחוז ב־Math500 מתאימים לעיבוד לוגי מדויק ופתרון בעיות.

  • עיבוד טקסט בשפות הודיות

    הוא עבר אימון ייעודי ל־22 שפות תת-היבשת ההודית לצד אנגלית ומספק בהן מענה עמוק.

איפה זה נופל

הנקודה החלשה ביותר שלו היא עבודה מעשית על בסיסי קוד גדולים, כפי שמשתקף בציון הנמוך יחסית ב־SWE Bench. בנוסף, הוא אומן עם דגש חזק על אנגלית ושפות הודו, כך שאין שום הבטחה או עדות לתמיכה איכותית בעברית. לפני שמשלבים אותו במוצר, צריך לבדוק היטב איך הוא מגיב לפקודות בעברית ואיך הוא מתמודד עם ניסוחים מקומיים, שכן מבחני הכתיבה הרגילים שלו נמוכים מחלק מהמתחרים.

אותה משפחה

sarvam יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

הכרטיס מצהיר על התמקדות באנגלית ובשפות הודיות בלבד. הוא עשוי לקלוט עברית בסיסית מתוך המידע הכללי באינטרנט, אבל הוא לא מותאם לשפה ולא נבדק עליה.

למה דרוש שרת גדול אם המודל מפעיל רק 10 מיליארד פרמטרים?

הארכיטקטורה מנתבת כל מילה לחלק קטן מהרשת, אך כל 106 מיליארד הפרמטרים שוקלים קרוב ל־400 גיגה-בייט וחייבים להיטען לזיכרון הגרפי ברקע.

האם קל להרים אותו ב־vLLM כבר עכשיו?

לא בצורה ישירה. התמיכה הרשמית עדיין פתוחה כהצעת שינוי, ולכן נדרש להריץ סקריפט התאמה מקומי או להתקין מגרסה מותאמת אישית של המפתחים.

איך מריצים

כדי להריץ מפלצת של 395 גיגה-בייט בקבצים תצטרכו שרת ייעודי כבד מאוד עם כמה כרטיסי מסך חזקים. למרות שבזמן ריצה פעילים רק כ־10.3 מיליארד פרמטרים, כל המשקולות חייבות לשבת בזיכרון. אם אין לכם גישה לאשכול שרתים מקצועי, אין מה לנסות להרים אותו על חומרה מקומית או ביתית.

מבחינת תוכנה, התמיכה ב־vLLM עדיין דורשת התקנה מפיצול קוד מותאם או הפעלת סקריפט תיקון מקומי, לחלופין אפשר להריץ אותו דרך SGLang מקוד המקור. אם אתם לא חייבים פרטיות מלאה של הנתונים או שליטה מוחלטת במשקולות, עדיף להמתין לממשק ענן או להשתמש ב־API מוכן.

from transformers import pipeline

pipe = pipeline("text-generation", model="sarvamai/sarvam-105b")
print(pipe("שלום"))

הקבצים

98 קבצים במאגר, 395 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקולות, להפיץ אותו מחדש ולשלב אותו במוצרים מסחריים סגורים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗