GPT
I

Instella-MoE-16B-A3B-Think

קוד פתוח

amdother2026-07-23

  • transformers
  • safetensors
  • deepseek_v3
  • text-generation
  • instella

זהו מודל מומחים של AMD שמפעיל רק 2.8 מיליארד פרמטרים מתוך 16 מיליארד בכל שלב. הוא מציע יכולות הסקה והנמקה שמתחרות במודלים כבדים בהרבה, תוך חיסכון בזמן חישוב.

  • 16Bפרמטרים
  • 32,768טוקנים בהקשר
  • 29.6 GBמשקל הקבצים
  • 2,301הורדות בחודש

מה זה

מדובר במודל MoE שעבר אימון מלא מהיסוד על חומרת AMD, החל משלב האימון המקדים ועד לחיזוק באמצעות למידת חיזוק. גרסת ה־Think היא השלב הסופי בציר הפיתוח, ומכוונת למעקב מדויק אחרי הוראות ופתרון בעיות שדורשות שרשרת מחשבה מעמיקה. הארכיטקטורה משלבת מנגנון תשומת לב מסוג Gated MLA יחד עם שישים וארבעה מומחים, כאשר בכל טוקן מופעלים שני מומחים משותפים וארבעה מומחים ייעודיים בלבד.

המשמעות של המבנה הזה בפועל היא יכולת להגיע לתוצאות של מודלים גדולים בלי לשלם את המחיר החישובי המלא בזמן הריצה. AMD שחררה את כל תחנות הביניים של תהליך האימון, מה שמאפשר לבחון בדיוק איך כל שלב, מאימון על הקשר ארוך ועד DPO, השפיע על ההתנהגות של המודל בסוף הדרך.

מתאים ל

  • מחקר והשוואת ארכיטקטורות

    ניתוח התנהגות של מודלי מומחים עם שכבות MLA ולמידת חיזוק על בסיס כל תחנות האימון.

  • משימות חשיבה מורכבות באנגלית

    הרצת תהליכי הסקה רב-שלביים באנגלית הדורשים שרשרת חשיבה מפורטת תחת משאבי חישוב מוגבלים.

  • בדיקת ביצועים על חומרת AMD

    הערכת תפוקה ויעילות של תשתית ROCm וספריית SGLang מול ארכיטקטורת MoE עדכנית.

איפה זה נופל

היוצרים מצהירים מראש שהמודל לא נבדק בשפות שאינן אנגלית, ולכן הרצה בעברית צפויה לייצר טעויות, חוסר הבנה או פלט שבור לחלוטין. אסור להסתמך עליו ביישומים שדורשים דיוק עובדתי מוחלט, מערכות קריטיות לבטיחות או ייעוץ רפואי.

בנוסף, המשקלים שוחררו ללא שכבת סינון בטיחותית מובנית. הוא עלול לפלוט תוכן פוגעני, מוטה או שגוי גם כשהקלט נראה תמים, כך שאי אפשר לחבר אותו ישירות למשתמשי קצה בלי להרים מערך סינון ובקרה משלכם.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

האימון והבדיקות התמקדו אך ורק באנגלית. היכולת שלו לעבד או לייצר עברית לא נבדקה על ידי AMD, והוא צפוי להחזיר תשובות שגויות או לא תקניות.

האם אפשר להשתמש בו באפליקציה מסחרית?

לא. הרישיון שבו המודל שוחרר מיועד למטרות אקדמיות ומחקריות בלבד, ולכן אינו מתאים למוצרים מסחריים.

איזה זיכרון נדרש להרצה מקומית?

המשקלים תופסים כ־29.6 גיגה בייט. להרצה בסיסית בפורמט המקורי תצטרכו כרטיס עם 32 גיגה זיכרון גרפי לפחות, או פיצול על פני מספר כרטיסים.

איך מריצים

כדי להריץ אותו צריך לטעון משקל של כמעט 30 גיגה בייט בפורמט bfloat16. זה דורש כרטיס מסך עם לפחות 32 גיגה זיכרון גרפי עבור הרצה פשוטה, או מערך של כמה כרטיסים אם רוצים לנצל את מלוא חלון ההקשר של 32,768 טוקנים. הרצה ישירה נעשית דרך ספריית transformers עם קוד מרוחק, או דרך מנוע SGLang לצורך קצב יצירת טוקנים גבוה יותר.

אם אין לכם חומרה ייעודית מתאימה, סביר להניח שיהיה קשה להריץ אותו מקומית בתצורתו המקורית בלי לבצע קוונטיזציה.

from transformers import pipeline

pipe = pipeline("text-generation", model="amd/Instella-MoE-16B-A3B-Think")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון מותאם אישית למחקר בלבד בשם ResearchRAIL. זה אומר שאין אישור לשימוש מסחרי, ואי אפשר להטמיע אותו במוצר שמייצר הכנסות או משרת לקוחות בפועל. השימוש מוגבל אך ורק לניסויים, בדיקות אקדמיות והערכה פנימית.

הרישיון המלא בעמוד המודל ↗