GPT
M

mamba-2.8b-slimpj

קוד פתוח

state-spacesapache-2.02023-12-11

  • transformers
  • pytorch
  • endpoints_compatible

ארכיטקטורת מצבים ליניארית שמנסה להחליף את הטרנספורמר המסורתי. מקבלים כאן מודל שרץ מהר יותר בהקשרים ארוכים ובגודל נוח של 2.8B פרמטרים.

  • 10.3 GBמשקל הקבצים
  • 150הורדות בחודש
  • 128לייקים

מה זה

מדובר במימוש של ארכיטקטורת Mamba, שמציעה חלופה למנגנון ה־Attention הרגיל של טרנספורמרים. המודל הספציפי הזה אומן על 600 מיליארד טוקנים מתוך מאגר SlimPajama, והוא מיועד לתת ביצועים תחרותיים בלי צוואר הבקבוק החישובי שנוצר בדרך כלל בהקשרים ארוכים.

ההבדל המרכזי מול מודלים רגילים בגודל הזה הוא האופן שבו הוא מעבד טקסט בזמן ריצה. במקום צריכת זיכרון שגדלה בריבוע ככל שהטקסט מתארך, כאן הזיכרון נשאר קבוע יחסית, מה שמאפשר לו להוציא טוקנים במהירות גבוהה גם כשמעמיסים עליו קלט רחב. זה כלי בסיסי שמתאים בעיקר למי שרוצה לבחון חלופות מודרניות למבנה הרגיל של רשתות שפה.

מתאים ל

  • השלמת טקסט באנגלית

    הוא אומן על 600 מיליארד טוקנים ממאגר מגוון ויודע לייצר המשכים קוהרנטיים במהירות.

  • בדיקת ארכיטקטורות חדשות

    מתאים למחקר והשוואת ביצועים מול מודלי טרנספורמר בגודל של כמעט שלושה מיליארד פרמטרים.

  • בסיס לאימון נוסף

    אפשר לקחת את המשקלים הקיימים ולבצע כוונון עדין למשימות סיווג או חילוץ מידע ייעודיות.

איפה זה נופל

המודל הזה אומן על טקסט כללי באנגלית מתוך SlimPajama, ולכן אין מה לבנות עליו לעברית או למשימות מורכבות בעברית. בנוסף, הוא מודל בסיס שעבר אימון ראשוני בלבד ולא עבר התאמה לשיחה, הנחיות או יישור ערכים. אם תתנו לו פקודה ישירה, הוא עלול פשוט להמשיך את הטקסט במקום לענות עליה, ולכן תצטרכו לאמן אותו בעצמכם או להשתמש בו להשלמת קוד וטקסט בלבד.

שאלות
נפוצות

האם אפשר להשתמש בו כצ'אטבוט?

לא ישירות מהקופסה. המודל אומן כמודל בסיס שמנחש את הטוקן הבא ולא עבר כוונון לשיחות, כך שהוא ימשיך משפטים במקום לענות כמו עוזר וירטואלי.

האם הוא נתמך בספריית transformers הרגילה?

הוא משתמש במשקלים שיושבים בפורמט התואם, אבל טעינת המודל מחייבת התקנה של ספריית mamba_ssm מהמאגר של state-spaces לפי ההוראות שם.

האם כדאי להריץ אותו בשביל טקסט בעברית?

לא כדאי. המאגר SlimPajama שעליו הוא התחנך מורכב בעיקר מאנגלית, ולכן התוצאות בשפות אחרות יהיו חלשות מאוד או חסרות היגיון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־10.3 גיגה-בייט, כך שתצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה-בייט של VRAM כדי לטעון אותו ולהריץ היקשים בצורה חלקה. הוא לא נטען ישירות דרך AutoModel הרגיל של transformers, אלא דורש את החבילה הייעודית mamba_ssm מהמאגר של המפתחים.

אם יש לכם מחשב מקומי בלי כרטיס תואם או שאתם צריכים רק תגובות מהירות בלי לנהל סביבת לינוקס וקרנלים ייעודיים של CUDA, שווה לחפש שרת שמציע גישה מוכנה. התקנת הספריות של Mamba דורשת לעיתים קומפילציה מקומית, וזה עלול להסתבך על חומרה לא מתאימה.

from transformers import pipeline

pipe = pipeline("text-generation", model="state-spaces/mamba-2.8b-slimpj")
print(pipe("שלום"))

הקבצים

4 קבצים במאגר, 10.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗