GPT
S

sarvam-m

קוד פתוח

sarvamaiapache-2.02025-05-20

  • transformers
  • safetensors
  • mistral
  • text-generation
  • conversational

מודל שפה של 24 מיליארד פרמטרים שמתמקד באנגלית ובשפות של הודו, עם יכולת להפעיל ולכבות מנגנון חשיבה. הוא מתאים למי שצריך קוד, מתמטיקה או עיבוד טקסט סביב השוק ההודי.

  • 24Bפרמטרים
  • 32,768טוקנים בהקשר
  • 43.9 GBמשקל הקבצים
  • 3,720הורדות בחודש

מה זה

בסיס המודל נשען על Mistral-Small, שעבר אימון המשך ייעודי כדי לחזק יכולות חשיבה ופתרון בעיות בשפות הודיות ובאנגלית. הוא כולל מצב חשיבה היברידי שבו אפשר לבחור אם להריץ שלבי חשיבה מעמיקים עבור משימות מורכבות, או להפיק תשובה ישירה ומהירה לשיחות רגילות.

לפי הנתונים שהמפתחים מציגים, יש כאן שיפור של 20% במבחני ביצועים בשפות הודיות, לצד עלייה של 21.6% במתמטיקה ו־17.6% בתכנות לעומת מודל הבסיס. הקפיצה הגדולה ביותר, תוספת של 86%, נרשמה במבחן GSM-8K של בעיות מילוליות במתמטיקה כשהן נכתבו בשפות הודיות בתעתיק לטיני.

מתאים ל

  • פיתוח מול קהל בהודו

    תמיכה מובנית בשפות הודיות בכתב מקומי ובתעתיק לטיני, עם התאמה תרבותית שהוטמעה באימון.

  • משימות קוד ופתרון בעיות

    מצב חשיבה ייעודי שמציג שיפור של מעל 17% במבחני תכנות ו־21% במתמטיקה מול מודל הבסיס.

  • בוטים עם בקרת ביצועים

    מעבר בין מצב חשיבה איטי ומעמיק לבין מצב שיחה מהיר שחוסך זמן ריצה כשאין צורך בניתוח מורכב.

איפה זה נופל

אם המוצר שלכם פונה לקהל ישראלי או דורש עברית, אין לכם מה לחפש כאן. המודל אומן מפורשות על אנגלית ושבע שפות הודיות כמו בנגלה, הינדי וטמילית, ולא על שפות שמיות. בנוסף, חלוקת המצבים לחשיבה דורשת מכם לנהל טמפרטורה שונה של 0.5 לחשיבה לעומת 0.2 לשיחה רגילה, אחרת איכות התשובות נפגעת.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס לא מציין תמיכה בעברית אלא באנגלית ושבע שפות הודיות בלבד. ניסיון לעבוד איתו בעברית יפיק כנראה תוצאות גרועות או ג'יבריש, ולמשימות מקומיות עדיף לבחור מודל רב-לשוני רחב יותר.

איך שולטים במצב החשיבה שלו?

בקוד שלכם שולחים הנחיה בהתאם לממשק. ב־vLLM או ב־API מגדירים את הפרמטר reasoning_effort, ובריצה מקומית מכוונים את הטמפרטורה ל־0.5 כדי לאפשר חשיבה או ל־0.2 בשביל שיחה ישירה.

איך מריצים

כדי להריץ אותו מקומית צריך להתמודד עם משקל קבצים של 43.9 גיגה-בייט בפורמט bfloat16. זה אומר שתצטרכו לפחות מעבד גרפי מקצועי עם 48 גיגה-בייט זיכרון, או שני כרטיסים של 24 גיגה-בייט, רק כדי לטעון אותו לפני שמחשבים את זיכרון ההקשר שמגיע ל־32,768 טוקנים.

אפשר להריץ אותו דרך ספריית transformers או לפרוס שרת תואם OpenAI עם vllm בגרסה 0.8.5 ומעלה. אם אין לכם חומרה כזאת פנויה, החברה מציעה ממשק API ייעודי שחוסך את עלויות התשתית הכבדות ומאפשר להפעיל את מצב החשיבה בפנייה פשוטה.

from transformers import pipeline

pipe = pipeline("text-generation", model="sarvamai/sarvam-m")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש מלא. אתם יכולים לקחת את המשקולות, להטמיע אותן במוצר מסחרי, לשנות את הקוד ולהריץ הכל מקומית בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗