GPT
F

falcon-mamba-7b-instruct

קוד פתוח

tiiuaeother2024-07-30

  • transformers
  • safetensors
  • falcon_mamba
  • text-generation
  • conversational

מודל שיחה שמבוסס כולו על ארכיטקטורת Mamba ולא על טרנספורמר רגיל. הוא פונה למי שמחפש ריצה יעילה של טקסטים ארוכים בלי הזיכרון הכבד שתופס מנגנון הריכוז.

  • 7.3Bפרמטרים
  • 13.5 GBמשקל הקבצים
  • 17,698הורדות בחודש
  • 73לייקים

מה זה

מדובר במודל שפה של 7.3 מיליארד פרמטרים מבית TII, שעבר אימון ייעודי למילוי הוראות ושיחה. בניגוד לרוב המודלים בגודל הזה, הוא אינו מכיל שכבות של תשומת לב עצמית, אלא נשען כולו על State Space Model. המבנה הזה נועד לייצר טוקנים בקצב קבוע ולשמור על צריכת זיכרון שטוחה גם כשהטקסט מתארך.

במדדי ביצועים הוא עומד יפה מול חלופות מקבילות. במבחן IFEval שבודק ציות להנחיות הוא הגיע לתוצאה של 33.36, ציון שעוקף מודלים כמו Llama 3 ו־Mistral 7B באותה בדיקה. במבחני ידע כללי מורכבים כמו MMLU הוא עומד על 62.11, מה שמציב אותו קרוב לטרנספורמרים ותיקים, אך ללא הזינוק בצריכת משאבים בזמן עיבוד רצפים ארוכים.

מתאים ל

  • עיבוד מסמכים ארוכים

    הארכיטקטורה שומרת על צריכת זיכרון נמוכה בריצה על טקסטים ארוכים במיוחד.

  • מענה לפקודות מוגדרות

    הציון שלו במבחני IFEval מראה יכולת טובה מאוד בציות למבנה והוראות מדויקות.

  • עוזרי שיחה באנגלית

    הוא עבר כוונון ייעודי לממשקי צ׳אט ומתאים לתשובות מהירות וממוקדות.

איפה זה נופל

המודל אומן בעיקר באנגלית. אין נתונים על עברית, והטוקנייזר שלו כנראה יתקשה מאוד וייקר את הריצה בטקסט מקומי. בנוסף, במבחני חשיבה מתמטית מתקדמת כמו MATH LvL5 הוא השיג ציון נמוך של 3.63, ובמבחן MMLU-PRO הוא קיבל 14.47 בלבד, נמוך בהרבה מ־Llama 3 שעומד שם על 24.55. אם המוצר דורש פתרון בעיות לוגיות עמוקות, הוא יאכזב.

אותה משפחה

falcon-mamba יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מסוגל לעבד עברית בצורה טובה?

הכרטיס מציין שהאימון בוצע בעיקר באנגלית על בסיס RefinedWeb ומקורות דומים. אין שום עדות ליכולת סבירה בעברית, וסביר להניח שהטוקנייזר ייצר שגיאות או יפעל באיטיות רבה.

איך ביצועי המהירות שלו לעומת טרנספורמר רגיל?

בטקסטים קצרים הוא מציג מהירות דומה לטרנספורמר עם Flash Attention 2. היתרון שלו בולט ככל שהקלט מתארך, מכיוון שזיכרון ה־KV אינו גדל עם אורך השיחה.

איך מריצים

כדי להריץ אותו בדיוק המקורי של bfloat16 תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון, כמו RTX 3090 או A10G. המודל שוקל 13.5 גיגה בייט בקבצים שלו, וניתן לטעון אותו גם בקוונטיזציה של 4 ביט דרך bitsandbytes כדי לדחוס אותו לכרטיסים צנועים יותר של 8 עד 12 גיגה בייט.

הוא עובד ישירות דרך ספריית transformers, אבל כדי לקבל ביצועי מהירות אמיתיים צריך להתקין את קרנלי ה־C של causal-conv1d ו־mamba-ssm. אם אין לכם גישה לכרטיס ייעודי או שאתם רק בודקים התכנות קצרה, קריאה לשירות ענן מנוהל תחסוך את ההתקנות המורכבות של התלויות האלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/falcon-mamba-7b-instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־TII Falcon-Mamba License 2.0. זהו אינו רישיון קוד פתוח סטנדרטי כמו Apache או MIT, אלא הסכם ייעודי של המכון באבו דאבי. לפני שילוב שלו במערכת מסחרית חובה לקרוא את תנאי המסמך המלאים של TII כדי לוודא שאין בו מגבלות הפצה או דרישות תמלוגים.

הרישיון המלא בעמוד המודל ↗