GPT
B

Bamba-9B-v1

קוד פתוח

ibm-ai-platformapache-2.02024-12-03

  • transformers
  • safetensors
  • gguf
  • bamba
  • text-generation

מודל בסיס בגודל 9.8 מיליארד פרמטרים שמבוסס על ארכיטקטורת Mamba-2 במקום טרנספורמר רגיל. הוא מיועד למי שמחפש לבדוק ארכיטקטורה חלופית או לאמן מודל משלו על בסיס פתוח לחלוטין.

  • 9.8Bפרמטרים
  • 4,096טוקנים בהקשר
  • 36.5 GBמשקל הקבצים
  • 15,320הורדות בחודש

מה זה

מדובר במודל שפת בסיס שפותח על ידי יבמ בשיתוף חוקרים מפרינסטון וקרנגי מלון, תוך שימוש במבנה של Mamba-2 משולב. הוא אומן בשני שלבים, תחילה על שני טריליון טוקנים ממאגר Dolma 1.7, ואז על 200 מיליארד טוקנים של מידע מסונן נוסף. המטרה כאן היא לייצר חלופה לטרנספורמר המסורתי ביצירת טקסט.

במבחני ביצועים רואים תמונה מעורבת. במשימות ידע כללי כמו Hellaswag ו־Piqa הוא מגיע ליותר מ־80 נקודות, וב־MMLU עומד על 60.77. מצד שני, במבחני חשיבה מורכבים יותר התוצאות נמוכות מאוד, למשל 1.66 בלבד ב־MATH שלב 5, ו־15.16 ב־IFEval. זה מראה בבירור שמדובר במודל בסיסי גולמי שעדיין לא עבר שום התאמה להוראות.

מתאים ל

  • אימון ייעודי למשימות ספציפיות

    נקודת פתיחה טובה לכוונון והתאמת מודל לארגון בזכות בסיס מאומן היטב ורישיון חופשי לחלוטין.

  • מחקר על ארכיטקטורת Mamba

    בדיקת התנהגות מודל שאינו מבוסס רק על טרנספורמר מלא, ישירות מול המימושים של מפתחיו.

  • השלמת טקסט כללית

    יצירה והמשך קטעי טקסט באנגלית שאינם דורשים לוגיקה מסובכת או מעקב אחר הוראות שיחה.

איפה זה נופל

זהו מודל בסיס בלבד, ללא כוונון להוראות או שיחות, כך שהוא לא יענה לכם כעוזר אישי אלא ינסה להמשיך את הטקסט. חלון ההקשר קצר יחסית ועומד על 4,096 טוקנים בלבד. במבחני פתרון בעיות ומתמטיקה הוא מקבל ציונים מזעריים, מה שאומר שאי אפשר להסתמך עליו ללוגיקה מורכבת בלי אימון ייעודי משלכם.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כבוט שיחה?

לא. מדובר במודל בסיס שרק משלים טקסט, והגרסאות שמכווננות לשיחה ולהוראות עדיין לא שוחררו בכרטיס המודל.

כמה זיכרון דרוש כדי להריץ אותו?

הגרסה המקורית תופסת כ־39 גיגה-בייט זיכרון. אם משתמשים בגרסת ה־FP8 המכומתת, דרישת הזיכרון יורדת לכ־10.8 גיגה-בייט.

האם אפשר להריץ אותו בקלות על מחשב נייד עם Ollama או llama.cpp?

לא כרגע. התמיכה ב־llama.cpp ניסיונית, דורשת הידור עצמי מפיצול קוד מיוחד, ורצה רק על המעבד ללא האצת כרטיס מסך.

איך מריצים

כדי להריץ אותו דרך ספריית transformers תצטרכו להתקין גרסה ישירות מ־GitHub, יחד עם תלויות מקור ייעודיות כמו causal-conv1d, mamba ו־flash-attention. המודל הגולמי שוקל 36.5 גיגה-בייט ודורש 39.12 גיגה זיכרון כדי לעלות ב־float32, כך שצריך כרטיס גרפי מקצועי וחזק או שימוש בגרסת ה־FP8 שמכווצת את צריכת הזיכרון ל־10.83 גיגה.

קיימת תמיכה ניסיונית בלבד ב־llama.cpp דרך פיצול קוד ייעודי, אבל נכון לעכשיו היא עובדת רק על המעבד ולא על GPU, וכימות דרך הכלי הזה פוגע בביצועים. אם אין לכם חומרה ייעודית וסביבת לינוקס מסודרת להידור הקרנלים של Mamba, ההרצה העצמאית תהיה מסורבלת מאוד.

ollama run hf.co/ibm-ai-platform/Bamba-9B-v1:bamba-9b

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים פנימיים ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗