GPT
N

Nemotron-Labs-TwoTower-30B-A3B-Base-BF16

קוד פתוח

nvidiaother2026-04-11

  • transformers
  • safetensors
  • nvidia
  • pytorch
  • two-tower

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הפיתוח הזה מחליף יצירת טקסט של מילה אחר מילה בשיטת דיפוזיה שמייצרת גושי מילים במקביל. הוא נועד לקצר זמני תגובה בלי לאבד כמעט מדיוק המודל המקורי.

  • 63Bפרמטרים
  • 118 GBמשקל הקבצים
  • 846הורדות בחודש
  • 142לייקים

מה זה

מדובר במודל שפה שמבוסס על שלד קיים אבל עובד עם שני מגדלים נפרדים. המגדל הראשון שומר ומעבד את ההקשר של הפרומפט, והמגדל השני מייצר גושים של טוקנים במקביל דרך הסרת רעש, במקום לחזות טוקן בודד בכל צעד. המבנה הפנימי משלב שכבות Mamba-2, מנגנון תשומת לב ומומחים מבוזרים, כשבפועל רק שלושה מיליארד פרמטרים פעילים בכל רגע נתון מתוך כל מגדל.

התוצאה בפועל היא מהירות כפולה פי 2.42 לעומת ריצה סדרתית רגילה. במבחני ביצועים הוא שומר על 98.7 אחוז מהיכולת של מודל הבסיס. במשימות ידע כללי כמו MMLU הוא מגיע ל־78.24 לעומת 78.56 במקור, כך שהירידה בדיוק כמעט ולא מורגשת ביחס לרווח בזמן הריצה.

מתאים ל

  • הפקת טקסט מהירה בשרת

    הוא חותך את זמן ההמתנה בחצי בזכות יצירת 16 טוקנים במקביל.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 128 אלף טוקנים מאפשר ניתוח קבצים כבדים בלי לקטוע אותם.

  • בסיס לאימון מודל פנימי

    המשקלים פתוחים ומאפשרים כוונון עדין למשימות ספציפיות על תשתית ארגונית.

איפה זה נופל

זהו מודל בסיס שלא עבר התאמה לשיחה, ולכן אי אפשר לזרוק אליו פרומפט של צ'אט ולצפות לתשובה מנומסת בלי אימון מקדים. בנוסף, יש ירידה מורגשת יותר במשימות שדורשות דיוק מתמטי וכתיבת קוד, שם המעבר לדיפוזיה הוריד את התוצאה ב־MATH-500 מ־84.40 ל־80.60 וב־HumanEval מ־79.27 ל־75.58. הוא גם אינו כולל תמיכה מובנית בעברית לפי רשימת השפות הרשמית, כך שטקסט מקומי ידרוש בדיקה מחמירה של פליטת ג'יבריש.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

רשימת השפות הרשמית שלו כוללת שמונה שפות בלבד ועברית אינה ביניהן. הוא אולי יזהה מילים בודדות אם הן הופיעו בדאטהסט הכללי, אבל בלי אימון ייעודי הוא ייצר שגיאות תחביר ואינו מתאים לעבודה בעברית.

אפשר להריץ אותו על גבי כרטיס מסך ביתי?

ממש לא. הקבצים שוקלים 118GB וחלוקת המגדלים דורשת לפחות שני כרטיסי A100 או H100 בנפח 80GB כדי לפעול במצב דיפוזיה מהיר.

במה שונה גרסה זו ממודל שפה רגיל?

במקום לחשב מילה אחת בכל פעם ברצף, המודל מתחיל מבלוק שמכיל מסיכות ומנחש קבוצה שלמה של מילים במקביל, מה שמקצר את זמן היצירה פי שניים ומעלה.

איך מריצים

כדי להריץ אותו צריך שני כרטיסי מסך מסוג A100 או H100 בנפח 80GB כל אחד, כי המשקל הכולל של הקבצים מגיע ל־118GB והארכיטקטורה מפצלת מגדל אחד לכל כרטיס. הריצה מתבצעת דרך ספריית transformers הרגילה של פייתון, אבל חייבים להפעיל הרצת קוד מרוחק כדי לתמוך בשיטת הדיפוזיה.

אם אין לכם שרת מקומי עם שני מאיצים כבדים כאלה, אין מה לנסות להריץ אותו במחשב אישי. במצב כזה עדיף לשלם לספק ענן חיצוני שמחזיק תשתית כזו ומחייב לפי שימוש, אלא אם מריצים רק את מגדל ההקשר לבדו בכרטיס יחיד, מה שמבטל לחלוטין את יתרון המהירות של הדיפוזיה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הפתוח של אנבידיה עבור נמוטרון, שמאפשר שימוש מסחרי בחינם. הרישיון מוגדר תחת תנאי שימוש ייעודיים של החברה ולא רישיון קוד פתוח סטנדרטי כמו MIT או אפאצ'י, לכן צוות משפטי צריך לבדוק את ההסכם לפני שילוב שלו במוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗