GPT
P

Param2-17B-A2.4B-Thinking

קוד פתוח

bharatgenaiרישיון לא דווח2026-02-16

  • transformers
  • safetensors
  • param2moe
  • text-generation
  • mixture-of-experts

מודל תערובת מומחים שמאקטב רק 2.4 מיליארד פרמטרים מתוך 17 ומציג יכולות חשיבה. הוא נבנה במיוחד לעבודה באנגלית, הינדי ושלל שפות הודיות.

  • 17Bפרמטרים
  • 32,768טוקנים בהקשר
  • 32.0 GBמשקל הקבצים
  • 8,854הורדות בחודש

מה זה

מדובר בארכיטקטורת MoE היברידית עם 64 מומחים, שבה בכל טוקן פועלים 2 מומחים קבועים ו־6 מומחים דינמיים. הרעיון הזה שומר על עלות חישוב נמוכה בזמן ריצה, שדומה למודל קטן, בזמן שהקיבולת הכוללת של הרשת נשארת רחבה. הוא אומן על יותר מ־22 טריליון טוקנים, כולל דאטה ייעודי למתמטיקה, קוד ותהליכי חשיבה ארוכים שמייצרים בלוקים של CoT לפני הפלט הסופי.

במבחני ביצועים רואים תמונה מעורבת. במשימות שנוגעות לשפות הודיות הוא עוקף בקלות מודלים כמו Qwen1.5 MoE, וגם במשימות ידע כללי כמו TriviaQA הוא מציג תוצאות מפתיעות לטובה. יחד עם זאת, במבחני היגיון וידע רחב באנגלית כמו MMLU עם ציון 57.79, ובפתרון בעיות מתמטיות ב־GSM8K עם ציון 57.32, הוא מפסיד למודלים ייעודיים כמו DeepSeek-R1 Distill 14B.

מתאים ל

  • עיבוד טקסט בשפות הודיות

    הוא אומן על עשרות שפות אזוריות בהודו ומציג ביצועים טובים בהבנת הקשר תרבותי מקומי.

  • שרתי הסקה עם משאבים מוגבלים

    ההפעלה של 2.4 מיליארד פרמטרים בלבד לטוקן מאפשרת מהירות הסקה של מודל קטן עם זיכרון רחב.

  • מחקר על ארכיטקטורות MoE

    מתאים למי שבוחן שילוב מומחים קבועים ומשתנים עם תהליכי חשיבה מובנים בקוד פתוח.

איפה זה נופל

המודל מוגדר במפורש כגרסת אימון מוקדמת ולא כמוצר סופי. במבחן IFEval למעקב אחרי הוראות מורכבות הוא קיבל ציון חלש של 34.05 בלבד, מה שאומר שהוא מתקשה לדייק במגבלות קשיחות. מעבר לזה, חלון ההקשר עומד על 32,768 טוקנים ואין תמיכה מובנית בעברית, כך שלא הייתי בונה עליו לשום עיבוד מסמכים ישראלי.

שאלות
נפוצות

האם כדאי להריץ את המודל למשימות בעברית?

לא. המודל אומן כמעט בלעדית על אנגלית, הינדי ועוד 21 שפות הודיות. אין לו ידע או יכולת תחבירית בעברית, והוא יחזיר פלטים שבורים או יתרגם לא נכון.

מה המשמעות של מודל חשיבה במקרה הזה?

המודל מפיק בלוק פנימי של תהליך הסקת מסקנות לפני שהוא פולט את התשובה למשתמש. התהליך הזה משפר פתרון בעיות במתמטיקה ובקוד, אך מייצר יותר טוקנים ומאריך את זמן ההמתנה לתשובה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־32 ג'יגה בייט בפורמט bf16. כדי לטעון אותו לזיכרון בלי קוונטיזציה תצטרכו כרטיס מקצועי של 48GB כמו A6000, או שני כרטיסי 24GB. אם תמירו אותו ל־4 ביט הוא ייכנס על כרטיס צרכני של 16GB או 24GB, אבל התקורה של ניתוב מומחים בזיכרון תדרוש תשומת לב.

בכרטיס המודל דורשים גרסה ספציפית של transformers, 4.52.3, ומציינים שמפענח מותאם אישית יושב בתוך התיקייה עצמה. אם המטרה שלכם היא להריץ שאילתות מזדמנות באנגלית ולא לבנות שירות מקומי שמתמקד בשפות תת-היבשת, עדיף בהרבה להשתמש ב־API של מודל מבוסס.

from transformers import pipeline

pipe = pipeline("text-generation", model="bharatgenai/Param2-17B-A2.4B-Thinking")
print(pipe("שלום"))

הרישיון

בדף הנתונים לא דווח רישיון רשמי, אך בכרטיס המודל מופיע תג עם רישיון לא מסחרי של BharatGen. המשמעות היא שאסור לשלב אותו בשום מוצר מסחרי, וכרגע הוא מיועד למחקר ולניסויים בלבד.

הרישיון המלא בעמוד המודל ↗