GPT
Z

Zamba2-7B-Instruct

קוד פתוח

Zyphraapache-2.02024-10-10

  • transformers
  • safetensors
  • zamba2
  • text-generation
  • conversational

מודל הוראות שמערבב שכבות Mamba2 עם מנגנוני קשב משותפים, כדי לייצר טקסט מהר יותר ובצריכת זיכרון נמוכה ממודלי שפה רגילים. הוא מתאים למי שמחפש ביצועים מהירים מקומית.

  • 7.4Bפרמטרים
  • 4,096טוקנים בהקשר
  • 27.7 GBמשקל הקבצים
  • 7,797הורדות בחודש

מה זה

הארכיטקטורה כאן חריגה בנוף. במקום להסתמך רק על טרנספורמר, הבסיס בנוי על שכבות Mamba2 שביניהן משולבות שכבות קשב שחולקות משקלים, יחד עם מטריצות LoRA מובנות כדי לשמור על דיוק בלי לנפח את כמות הפרמטרים. המטרה של השילוב הזה היא לחתוך את זמני ההמתנה לטוקן הראשון ולהאיץ את קצב הפליטה בזמן ריצה.

במבחני ביצועים הוא מציג תמונה מעורבת. במעקב אחרי הוראות בסיסיות הוא עומד על 69.95 בציון IFEval, שזה נתון יפה לגודל כזה. מצד שני, במבחני חשיבה מורכבים יותר המצב שונה לגמרי, עם ציון של 13.57 במתמטיקה רמה חמש, וציון של 10.28 בלבד ב־GPQA. הוא מיועד בעיקר לשיחה ולביצוע פקודות ישירות, לא לפיצוח בעיות מדעיות.

מתאים ל

  • בוטים ומענה מהיר

    צריכת הזיכרון הנמוכה וזמן התגובה הקצר מתאימים לשרתי צ'אט שצריכים להחזיר תשובות בזריזות.

  • מעקב אחר הוראות פשוטות

    התוצאה ב־IFEval טובה יחסית לגודל שלו, ומתאימה למשימות של ניסוח מחדש או חילוץ מידע לפי פורמט.

  • עיבוד טקסטים עד 16k

    מצב ההקשר הניסיוני מאפשר סריקה ומציאת עובדות במסמכים באורך בינוני בלי לקרוס.

איפה זה נופל

החולשה העיקרית נמצאת ביכולות הסקת מסקנות מתקדמות. המבחנים בכרטיס מעידים על קושי ממשי, עם ציונים נמוכים במיוחד כמו 8.21 ב־MUSR ו־33.33 ב־BBH. בנוסף, חלון ההקשר המורחב של 16k מוגדר רשמית כניסיוני, והמפתחים מציינים שהביצועים באיתור מידע צונחים בצורה חדה מעבר ל־18 אלף טוקנים. היישום בספריית transformers הוא זמני, כך שייתכנו שגיאות תאימות עם ספריות הרצה חיצוניות. לא מומלץ לבנות עליו לפרויקטים בעברית בלי בדיקה עצמאית מקיפה, כי אין שום תיעוד על נתוני האימון בשפה.

אותה משפחה

Zamba2 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל נתמך כרגע בכל כלי הרצה סטנדרטי?

לא. המפתחים מבהירים שמדובר במימוש זמני ב־transformers שעשוי לא להתאים לחלק מהכלים והספריות המקובלות. בנוסף, כדי לקבל מהירות נורמלית חייבים להתקין ספריות ייעודיות של Mamba ישירות מהקוד.

האם שווה לבחור בו במקום מודל 7B רגיל?

רק אם צוואר הבקבוק העיקרי שלכם הוא זמן התגובה לטוקן הראשון וצריכת הזיכרון בשרת. אם המשימה שלכם כוללת לוגיקה מורכבת, חישובים או שאלות רב־שלביות, הציונים הנמוכים שלו במבחנים האלה מעידים שהוא יתקשה מאוד ביחס למודלים מקבילים.

איך מריצים

כדי להריץ אותו כמו שצריך תצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי לטעון את המשקלים בפורמט bfloat16, במיוחד אם מפעילים את מצב ההקשר המורחב שמגיע עד 16 אלף טוקנים בעזרת דגל ייעודי. הקבצים עצמם שוקלים 27.7 גיגה, כך שזה ידרוש מקום ואחסון מהיר.

ההתקנה דורשת עבודה ידנית. המפתחים מציינים במפורש שחובה לקמפל את transformers ישירות מהמאגר, ולהתקין קרנלים של mamba-ssm ו־causal-conv1d כדי לקבל את מהירות הריצה שהם מדברים עליה. אפשר להריץ בלעדיהם, אבל המודל יזחל ויצרוך הרבה יותר זיכרון, מה שמבטל את כל היתרון שלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="Zyphra/Zamba2-7B-Instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך המוצרים שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗