GPT
S

sarvam-30b

קוד פתוח

sarvamaiapache-2.02026-03-03

  • transformers
  • safetensors
  • sarvam_moe
  • text-generation
  • conversational

מודל מומחים הודי עם 32 מיליארד פרמטרים שרק 2.4 מיליארד מתוכם פעילים בכל רגע. הוא מיועד למי שצריך תמיכה מעמיקה בשפות הודיות וקריאה לכלים בלי לשלם עלויות עיבוד של מודל ענק.

  • 32Bפרמטרים
  • 131,072טוקנים בהקשר
  • 120 GBמשקל הקבצים
  • 177,183הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים שכוללת 128 מומחים ומומחה משותף אחד, כאשר הניתוב מפעיל שישה מומחים בלבד לכל טוקן. המבנה הזה נשען על 19 שכבות ואינטרפולציית רופ גבוהה במיוחד, מה שמאפשר לו לעבד הקשר ארוך בלי לסחוב משקל חישובי כבד בזמן הריצה.

במבחני ביצועים הוא מציג מספרים מעניינים. במתמטיקה וקוד הוא מגיע ל־97 במבחן Math500 ול־70 ב־Live Code Bench v6, תוצאה שעוקפת מודלים כמו Gemma 27B ומתחרה יפה מול Qwen3. מצד שני, במבחני שיחה חופשית והערכת העדפות אנושיות כמו Arena Hard v2 הוא קיבל ציון נמוך של 49, ובמשימות סוכן כמו SWE Bench Verified הוא מגיע ל־34 בלבד, מה שמראה שהכוח שלו מרוכז בעיקר בפתרון בעיות מוגדרות ולא בדיאלוג מורכב או בבניית תוכנה אוטונומית.

מתאים ל

  • בוטים קוליים בהודו

    הוא מיועד מראש לשיחות קוליות רב־לשוניות בהודית בשילוב הפעלת כלים בזמן אמת.

  • פתרון בעיות חישוב ומתמטיקה

    עם ציון של 97 ב־Math500, הוא מספק מענה מעולה לחישובים מורכבים במשאבי זמן ריצה נמוכים.

  • סקריפטים ואוטומציה נקודתית

    התוצאות הגבוהות ב־HumanEval ו־MBPP מתאימות לכתיבת קוד תחום ומוגדר היטב.

איפה זה נופל

אם אתם בונים מוצר בעברית, אין לכם מה לחפש כאן. המודל מתמקד באנגלית וב־22 שפות הודיות בלבד, כך שכל קלט או פלט בשפות אחרות צפוי להיכשל לחלוטין. מעבר לכך, הביצועים שלו בשיחות כלליות בינוניים מאוד לפי מבחן Arena Hard, והוא לא מצטיין במשימות תכנות רחבות שדורשות עבודה אוטונומית ברמת מאגר קוד שלם.

אותה משפחה

sarvam יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן באופן מובהק על אנגלית ושפות הודיות כמו הינדי, בנגלית וטמילית. אין לו תמיכה מובנית בעברית ולא כדאי לבנות עליו לעיבוד טקסט ישראלי.

איך מודל של 32 מיליארד פרמטרים רץ מהר?

הוא בנוי כמודל מומחים שבו כל טוקן מפעיל רק 2.4 מיליארד פרמטרים מתוך הסך הכולל. כמות החישובים בפועל קטנה בהרבה, אם כי עדיין חייבים מספיק זיכרון כדי להחזיק את כל המשקלים בנפח של 120 גיגה בייט.

האם אפשר להריץ אותו ישירות עם vLLM?

לא בהתקנה נקייה רגילה. התמיכה עדיין נמצאת בהצעת שינוי פתוחה, ולכן צריך להשתמש בסקריפט ההתאמה שהמפתחים צירפו או להתקין גרסה מפוצלת מקוד המקור.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־120 גיגה בייט, כך שאי אפשר להריץ אותו על חומרה ביתית פשוטה. כדי לטעון אותו בזיכרון תצטרכו שרת עם מספר כרטיסי מסך או מאיצים בעלי זיכרון וידאו רחב, במיוחד אם אתם מתכוונים לנצל את מלוא חלון ההקשר. היתרון הוא שבזמן ההסקה בפועל המודל דורש כוח חישוב שווה ערך למודל של 2.4 מיליארד פרמטרים בלבד.

ההרצה המקומית עדיין דורשת התעסקות ידנית. התמיכה ב־vLLM טרם הוטמעה בגרסה הרשמית ודורשת הרצת סקריפט התאמה או הידור של פיצול קוד מותאם, וחלופה נוספת היא התקנת SGLang ישירות מקוד המקור. אם אתם לא מחזיקים תשתית מתאימה או לא רוצים לתחזק גרסאות תוכנה לא רשמיות, עדיף להמתין לייצוב התמיכה או לצרוך אותו דרך שרת ייעודי שכבר הוגדר מראש.

from transformers import pipeline

pipe = pipeline("text-generation", model="sarvamai/sarvam-30b")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים פנימיים או חיצוניים ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת שיתוף של שינויים שתבצעו בעצמכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗