GPT
A

AI21-Jamba2-3B

קוד פתוח

ai21labsapache-2.02026-01-06

  • transformers
  • safetensors
  • jamba
  • text-generation
  • conversational

מודל קומפקטי של שלושה מיליארד פרמטרים שמציע חלון הקשר ענקי של 256K. הוא מיועד לריצה מקומית על טלפונים ומחשבים אישיים עם דגש על היצמדות להוראות ולמקורות מידע.

  • 3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 6.0 GBמשקל הקבצים
  • 9,060הורדות בחודש

מה זה

מדובר במודל שפותח על בסיס ארכיטקטורה היברידית של Mamba יחד עם Transformer, שילוב שנועד לאפשר עיבוד של טקסטים ארוכים במיוחד בלי לפוצץ את צריכת הזיכרון. למרות גודלו הצנוע, הוא כולל 28 שכבות ומציע חלון הקשר עצום של 262,144 טוקנים, נתון חריג למדי בקטגוריית המשקל הזו.

לפי נתוני הפיתוח, הוא עבר אימון ביניים על 500 מיליארד טוקנים של קוד, מתמטיקה ומסמכים ארוכים, לצד כוונון בשיטות DPO ולמידת חיזוק. במבחני ביצועים כמו IFEval, IFBench, Collie ו־FACTS הוא מכוון למשימות ארגוניות שדורשות ציות מדויק למגבלות ניסוח ונאמנות לחומר המקור, מה שהופך אותו למועמד טבעי לשילוב בתוך מערכות שליפת מידע.

מתאים ל

  • ריצה מקומית על מכשירי קצה

    משקל של 6GB מאפשר להריץ אותו ישירות על מחשבים ניידים וטלפונים בלי לשלוח נתונים החוצה.

  • שליפת מידע ומענה על מסמכים

    חלון הקשר של 256K ודגש על מבחני אמינות כמו FACTS עוזרים לעבד תיקיות מסמכים שלמות.

  • הפעלת כלים וציות לפקודות

    אימון ייעודי על IFEval מסייע לו לעקוב אחרי פורמטים קשיחים של פלט והפעלת פונקציות.

איפה זה נופל

מודל של שלושה מיליארד פרמטרים נשאר מוגבל בידע הכללי שלו ולא יתחרה במודלי ענק בכל הקשור להיגיון מורכב או כתיבה יצירתית עמוקה. בנוסף, הארכיטקטורה ההיברידית דורשת ספריות תשתית ייעודיות וגרסאות עדכניות מאוד של vLLM ו־transformers, מה שעלול לסבך את ההטמעה בסביבות לינוקס ישנות או במערכות ללא הידור מתאים.

שאלות
נפוצות

האם המודל באמת יכול לרוץ על טלפון סלולרי?

הוא שוקל 6 גיגה בייט בגרסתו המלאה, כך שבמכשירים עם זיכרון עבודה גבוה אפשר להריץ אותו, במיוחד לאחר קוונטיזציה. המפתחים תכננו את הארכיטקטורה בדיוק עבור סביבות כאלה שבהן משאבי החומרה מוגבלים.

מה המשמעות של ארכיטקטורת Mamba ו־Transformer?

חלון הקשר של 256K דורש בדרך כלל זיכרון עצום במודלי שנאי רגילים. שילוב שכבות SSM מקטין את העומס החישובי ומאפשר לקרוא טקסטים ארוכים בלי לקרוס.

האם אפשר להשתמש בו ישירות מתוך ספריית transformers?

כן, החל מגרסה 4.54.0. עם זאת, חובה להתקין חבילות תומכות כמו causal-conv1d ו־mamba-ssm כדי שהשכבות הייעודיות ירוצו.

איך מריצים

המשקל הכולל של הקבצים עומד על 6 גיגה בייט, כך שכרטיס מסך בסיסי או מעבד של מחשב אישי מודרני מספיקים כדי לטעון אותו לזיכרון. אפשר להריץ אותו דרך ספריית transformers הרגילה, אבל צריך להתקין חבילות ייעודיות כמו mamba-ssm ו־causal-conv1d כדי לתמוך בשכבות ה־SSM.

לסביבת ייצור ממליצים להשתמש בשרת vLLM מגרסה 0.10.2 ומעלה, עם תמיכה מובנית בקריאות לכלים ובזיכרון מטמון. אם אתם רק צריכים מודל קל בטלפון או בלפטוף בלי תלות ברשת, הרצה מקומית הגיונית לגמרי. ברגע שצריך לשרת משתמשים רבים במקביל, כדאי לשקול שרת מרכזי.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai21labs/AI21-Jamba2-3B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗