GPT
F

falcon-mamba-7b

קוד פתוח

tiiuaeother2024-07-17

  • transformers
  • safetensors
  • falcon_mamba
  • text-generation
  • en

זה מודל שפה של 7.3 מיליארד פרמטרים שמבוסס על ארכיטקטורת Mamba נטולת מנגנון תשומת לב. הוא מתאים למי שמחפש יעילות של מודל מצב במקום טרנספורמר רגיל.

  • 7.3Bפרמטרים
  • 13.5 GBמשקל הקבצים
  • 34,690הורדות בחודש
  • 248לייקים

מה זה

במקום המבנה הרגיל של רשתות טרנספורמר, המודל הזה משתמש בארכיטקטורת SSM טהורה עם 64 שכבות. הוא נוצר כדי לבצע חיזוי של הטוקן הבא באנגלית, ואומן על כחמש וחצי טריליון טוקנים שכללו טקסט רשת מסונן, קוד, מתמטיקה ונתונים טכניים.

במבחני ביצועים הוא עוקף מודלים דומים מבוססי SSM כמו mamba-7b-rw הישן יותר, ומציג תוצאות שמתחרות ישירות בדגמי טרנספורמר ותיקים בגודל הזה. בלוח המבחנים הראשון הוא הגיע לציון ממוצע של 64.09, קרוב מאוד לביצועים של Falcon2-11B ושל משפחת Llama 3 בגודל שמונה מיליארד פרמטרים.

מתאים ל

  • אימון בסיס להוראות באנגלית

    מתאים לכוונון נוסף של שיחה או משימות ספציפיות, בזכות בסיס טקסטואלי חזק של 7.3 מיליארד פרמטרים.

  • מחקר ארכיטקטורות SSM

    מאפשר לבחון התנהגות של מודל Mamba טהור בקנה מידה גדול מול ארכיטקטורות טרנספורמר מוכרות.

  • עיבוד רצפים ארוכים

    מתאים לתרחישים שדורשים יצירת טקסט ללא המגבלות החישוביות הרגילות של מנגנון תשומת לב מלא.

איפה זה נופל

המודל אומן בעיקר על אנגלית ולא כולל תמיכה מובנית בשפות אחרות, כך שלעברית הוא לא מיועד. בנוסף, מדובר במודל בסיס לחיזוי טקסט שלא עבר כוונון להוראות או לצ'אט, ולכן הוא לא יודע לענות לשאלות כעוזר בלי שתאמנו אותו קודם. במבחנים קשים כמו מתמטיקה ברמה גבוהה התוצאות נשארות נמוכות מאוד, עם 3.63 נקודות בלבד בבדיקת MATH.

אותה משפחה

falcon-mamba יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין שהאימון בוצע בעיקר באנגלית. הוא לא נבנה לעברית, ולכן פלט בשפה זו צפוי להיות משובש או שגוי לחלוטין.

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא. זהו מודל בסיס של השלמת טקסט שלא עבר התאמה לשיחות או ביצוע פקודות. כדי לדבר איתו צריך לאמן אותו קודם על נתוני הוראות.

האם הוא דורש התקנות מיוחדות מעבר לספריית transformers?

כן. כדי לנצל את הארכיטקטורה ולקבל קצב ריצה סביר, יש להתקין חבילות ייעודיות כמו mamba-ssm וגרסה מתאימה של causal-conv1d.

איך מריצים

המשקל הכולל של הקבצים עומד על 13.5 גיגה בייט בפורמט bfloat16. כדי להריץ אותו בצורה מקומית צריך מעבד גרפי עם לפחות 16 עד 24 גיגה בייט של זיכרון וידאו, או לחלופין לבצע קוונטיזציה לארבע ביט בעזרת bitsandbytes כדי להסתפק בחומרה צנועה יותר.

אפשר להריץ אותו ישירות דרך ספריית transformers הרגילה, אבל כדי לקבל ביצועים סבירים צריך להתקין קרנלים ייעודיים של causal-conv1d ושל mamba-ssm. אם אין ברשותכם כרטיס גרפי תואם שמאפשר הידור עם torch.compile, עדיף להריץ אותו דרך שרת ייעודי בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="tiiuae/falcon-mamba-7b")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון ייעודי שנקרא TII Falcon-Mamba License 2.0. זה לא רישיון קוד פתוח סטנדרטי כמו Apache או MIT, ולכן צריך לקרוא את התנאים המשפטיים המדויקים שלו לפני שמשלבים אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗