GPT
M

mamba-130m-hf

קוד פתוח

state-spacesרישיון לא דווח2024-03-06

  • transformers
  • safetensors
  • mamba
  • text-generation
  • text-generation-inference

גרסה מוקטנת של ארכיטקטורת ממבה מותאמת לספריית transformers. שוקלת פחות מחצי גיגה ומתאימה בעיקר לבדיקות מקומיות וניסויים בארכיטקטורות שאינן טרנספורמר.

  • 129Mפרמטרים
  • 495 MBמשקל הקבצים
  • 261,752הורדות בחודש
  • 72לייקים

מה זה

מדובר במודל שפה קטן של 129 מיליון פרמטרים שמבוסס על ארכיטקטורת State Space ולא על טרנספורמר רגיל. המטרה כאן היא יצירת טקסט, אבל במקום מנגנון תשומת לב כבד שדורש משאבים גדלים ככל שהטקסט מתארך, הארכיטקטורה הזו מעבדת מידע בצורה שונה. הגרסה הזו נבנתה ישירות לתוך המערכת של transformers בלי שתצטרכו לכתוב קוד עוטף מיוחד.

המשקל שלו בקבצים עומד על 495 מגה בייט בסך הכול. בגודל כזה לא תקבלו תשובות חכמות או יכולת ניתוח עמוקה, אבל הוא מספק בסיס קל מאוד להרצה וללמידה על התנהגות של מודלים מבוססי ממבה.

מתאים ל

  • בדיקת ארכיטקטורה חדשה

    מאפשר לבדוק את התנהגות ממבה בסביבת הפיתוח שלכם בלי להוריד עשרות גיגות של משקלים.

  • אימון ייעודי על חומרה חלשה

    אפשר לכוונן אותו עם peft על כרטיס מסך בודד ופשוט לצורך משימת ניתוב או זיהוי תבניות קצרות.

  • בדיקות אינטגרציה בקוד

    מתאים לבדיקות תוכנה מקומיות שמחפשות ולידציה של פלט טקסטואלי מהיר בלי לחכות למודל כבד.

איפה זה נופל

המודל הזה קטן מאוד, עם פחות מ־130 מיליון פרמטרים, מה שאומר שהוא יפלוט טעויות, יחזור על עצמו וייכשל במשימות שדורשות היגיון בסיסי. בדף שלו מצוין בטעות שמדובר בגרסת 2.8B, מה שמראה שהתיעוד נכתב בחופזה ודורש בדיקה כפולה. בנוסף, מי שרוצה ביצועים טובים חייב לקמפל קרנלים ספציפיים לכרטיס המסך, ולא כולם רוצים להסתבך עם התקנות כאלה בסביבת עבודה מקומית.

אותה משפחה

mamba יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אני חייב כרטיס מסך כדי להריץ את המודל הזה?

לא. הוא שוקל פחות מחצי גיגה ויעבוד גם על המעבד הרגיל שלכם במימוש eager. יחד עם זאת, אם תרצו מהירות אמיתית תצטרכו כרטיס מסך ואת החבילות הייעודיות שהמפתחים מציינים בהנחיות ההתקנה.

האם אפשר להשתמש בו ישירות לצ'אט בעברית?

ממש לא. המודל קטן מדי בשביל להבין מבנים מורכבים, ואין שום תיעוד שהוכנס לו חומר בעברית. הוא ייצר טקסטים קצרים באנגלית וישמש בעיקר לבדיקות קוד ותשתיות.

איך מריצים

טוענים אותו ישירות דרך פייתון עם MambaForCausalLM וטוקנייזר תואם מתוך ספריית transformers. כדי לקבל מהירות ריצה נורמלית על גבי CUDA, צריך להתקין שתי חבילות ייעודיות: causal-conv1d בגרסה 1.2.0 ומעלה, ואת mamba-ssm. אם לא תתקינו אותן, הקוד עדיין יעבוד במימוש איטי יותר, אבל תבזבזו כוח עיבוד.

בגלל המשקל הקטן שלו, כל מעבד סביר או כרטיס מסך ביתי בסיסי יריצו אותו בלי מאמץ, ואפשר גם לכוונן אותו עם ספריות כמו peft בדיוק של float32. אין שום סיבה לשלם למישהו על API חיצוני בשביל גודל כזה, אפשר פשוט להריץ אותו ישירות על הלפטוף.

from transformers import pipeline

pipe = pipeline("text-generation", model="state-spaces/mamba-130m-hf")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 495 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

למודל הזה לא דווח רישיון כלל בעמוד שלו. כשאין רישיון מוגדר, מבחינה משפטית אין לכם היתר ברור להשתמש בקוד ובמשקלים בתוך מוצר מסחרי, וחברות עם בדיקות תאימות קפדניות ייאלצו לפסול אותו מראש עד שהיוצרים יעדכנו תנאי שימוש ברורים.

הרישיון המלא בעמוד המודל ↗