GPT
A

AI21-Jamba-Reasoning-3B

קוד פתוח

ai21labsapache-2.02025-10-05

  • transformers
  • safetensors
  • jamba
  • text-generation
  • conversational

מודל היברידי קומפקטי שמביא חשיבה מורכבת וחלון של 256 אלף טוקנים למכשירים אישיים. הוא מתאים למי שרוצה ביצועים חזקים של עיבוד מסמכים ארוכים בלי להחזיק שרת כבד.

  • 3.2Bפרמטרים
  • 262,144טוקנים בהקשר
  • 6.0 GBמשקל הקבצים
  • 15,253הורדות בחודש

מה זה

הארכיטקטורה כאן משלבת בין מנגנון תשומת הלב של טרנספורמר לבין שכבות של ממבה, עם 26 שכבות ממבה ורק שתי שכבות של אטנשן. המבנה הזה פותר את צוואר הבקבוק המוכר של זיכרון בטקסטים ארוכים, כי הוא לא צריך לשמור מטמון ענקי לכל טוקן. המודל שוקל 6 גיגה בייט בלבד, אבל יודע להתמודד עם רצפים שמגיעים לרבע מיליון טוקנים תוך שמירה על מהירות גבוהה.

במבחני הביצועים הפער בולט בעיקר במעקב אחרי הוראות מורכבות. במבחן איף בנץ׳ הוא מקבל 52 אחוזים, שזה כמעט כפול מדגמים מתחרים בגודל דומה כמו למה 3.2 או ג׳מה 3. במבחן אם אם אל יו פרו הוא רושם 61 אחוזים, ועוקף את רוב המודלים הקטנים מלבד קוון 3 בגודל 4 מיליארד פרמטרים. בנוסף יש לו תמיכה ישירה בעברית יחד עם עוד שמונה שפות, מה שהופך אותו לרלוונטי מאוד למי שמפתח בארץ.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של 256 אלף טוקנים עם שכבות ממבה מאפשר לנתח חוזים וספרים שלמים בלי לחנוק את הזיכרון של המחשב.

  • עבודה עם הוראות מורכבות

    הציון הגבוה בבדיקות איף בנץ׳ הופך אותו למתאים במיוחד להפקת פלטים במבנה קשיח וקריאות לכלים חיצוניים.

  • הרצה מקומית בעברית

    הוא כולל עברית כשפת מקור ורץ על 6 גיגה בייט, שילוב נדיר למערכות שחייבות להישאר לגמרי בתוך הרשת הפנימית.

איפה זה נופל

למרות שהוא מוגדר כמודל חשיבה וכולל פרסר ייעודי ללוגיקה, הממדים שלו עדיין קטנים. במבחן הומניטיז לאסט אגזם הוא מקבל 6 אחוזים בלבד, שזה אומנם גבוה מהמתחרים בסדרי הגודל שלו, אבל מראה בבירור שלמשימות ידע קיצוניות או הוכחות מדעיות עמוקות הוא לא באמת בנוי. בנוסף, הארכיטקטורה ההיברידית מחייבת רכיבי תוכנה ספציפיים מאוד בהרצה מקומית, מה שעלול לסבך פריסה בסביבות ייצור סטנדרטיות שלא מותאמות מראש לממבה.

אותה משפחה

AI21-Jamba-Reasoning יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים כרטיס מסך חזק כדי לעבד טקסטים ארוכים?

לא. הארכיטקטורה ההיברידית מבוססת ברובה על ממבה, שמנהלת את הזיכרון באופן ליניארי ולא דורשת מטמון ענק. זה מאפשר לעבד חלונות ארוכים גם בחומרה צנועה יחסית.

איך המודל מתמודד עם עברית לעומת אנגלית?

עברית מופיעה ברשימת השפות הנתמכות שהוגדרו רשמית באימון של הדגם. עם זאת, אימוני ההמשך למתמטיקה ולוגיקה בוצעו ברובם על חומרים באנגלית, ולכן משימות חשיבה מורכבות עדיף לנסח באנגלית כשמתאפשר.

איך מריצים

כדי להריץ אותו מקומית אפשר להשתמש בטרנספורמרס מגרסה 4.54 או דרך וי אל אל אם מגרסה 0.11 ומעלה. ההתקנה דורשת ספריות ייעודיות כמו ממבה אס אס אם, קונוו וואן די ופלאש אטנשן, כך שצריך לוודא שהסביבה תומכת בהידור המודולים האלה לפני שמתחילים. המפרסם מציע גם גרסת ג׳י ג׳י יו אף שמאפשרת עבודה נוחה על מחשבים ניידים ומכשירי קצה.

משקל הקבצים עומד על 6 גיגה בייט, כך שכרטיס מסך ביתי או מחשב נייד עם זיכרון סביר מריצים אותו בלי בעיה. אם התשתית שלכם לא מסתדרת עם התלויות של ממבה או שאתם צריכים רק שאילתות בודדות פעם ביום, יהיה פשוט יותר לפנות לשירות מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai21labs/AI21-Jamba-Reasoning-3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ׳י 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו בתוך מוצרים סגורים ולהפיץ אותם חופשי, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗