GPT
G

gpt-oss-120b-Eagle3-long-context

קוד פתוח

nvidiaother2025-08-18

  • Model Optimizer
  • safetensors
  • llama
  • nvidia
  • ModelOpt

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שכבת האצה ייעודית שנועדה להכפיל את קצב ייצור הטוקנים במודל הענק של OpenAI. אם אתם מריצים את הבסיס בהקשרים ארוכים, הרכיב הזה יקצר את זמני התגובה.

  • 215Mפרמטרים
  • 131,072טוקנים בהקשר
  • 411 MBמשקל הקבצים
  • 4,038הורדות בחודש

מה זה

מדובר ברכיב עזר של 215 מיליון פרמטרים שמיועד לעבוד אך ורק לצד מודל הבסיס gpt-oss-120b. הוא מיישם פענוח ספקולטיבי בשיטת Eagle3, שבה רשת קטנה מנחשת כמה טוקנים קדימה ומודל הבסיס מאמת אותם בבת אחת, במקום לחשב כל טוקן בנפרד.

המטרה כאן היא חסכון ישיר בזמן חישוב בהקשרים של מעל 8,000 טוקנים ועד 131,072 טוקנים. במבחני MT-Bench עם אורך טיוטה של שלושה טוקנים, שיעור הקבלה נע בין 1.95 במדעי הרוח לבין 2.83 במתמטיקה ו־2.51 בקוד. המשמעות בפועל היא שבמשימות חישוביות מודל הבסיס מאשר כמעט את כל הרצף שנזרק אליו ומייצר קרוב לפי שלושה טוקנים בכל צעד אינפרנס.

מתאים ל

  • האצת סוכני קוד בהקשר רחב

    שיעור קבלה של 2.51 במשימות תכנות מאפשר לקצר זמני תגובה בריצת סוכנים שסורקים בסיסי קוד ענקיים.

  • מערכות RAG עם מסמכים ארוכים

    שליפת מידע מהקשר של עד 131 אלף טוקנים תוך שמירה על קצב פליטת תשובות מהיר יחסית לגודל הרשת.

  • פתרון בעיות מתמטיות מורכבות

    שיעור קבלה של 2.83 טוקנים בצעד אחד הופך את הפענוח הספקולטיבי ליעיל במיוחד בחישובים ארוכים.

איפה זה נופל

הרכיב הזה חסר תועלת לחלוטין עבור פרומפטים קצרים, והמפתחים מפנים במפורש לגרסת ה־short-context עבור משימות של פחות מ־8k טוקנים. מעבר לזה, הכרטיס מודה שלא בוצעו שום פעולות לצמצום הטיות ושהאימון התבסס על מידע מהרשת שכולל שפה פוגענית. המודל עלול לפלוט טקסטים מוטים, להחסיר מידע קריטי או לייצר מלל לא מדויק, כך שאי אפשר להכניס אותו למערכת מבלי לבנות שכבת בדיקות וסינון עצמאית לחלוטין.

שאלות
נפוצות

האם המודל הזה עובד לבד?

לא. זהו ראש ספקולטיבי בלבד בגודל 215 מיליון פרמטרים. הוא חייב לרוץ בצמוד למודל המלא gpt-oss-120b דרך TensorRT-LLM.

למה לא להשתמש בו לכל משימת שיחה רגילה?

בשיחות קצרות של פחות מ־8k טוקנים הוא לא יעיל, ואנבידיה ממליצה להשתמש בגרסת ה־short-context. המודל הזה אומן ומיועד ספציפית לעבודה מול הקשרים ארוכים.

איזו תוכנה נדרשת כדי להפעיל את הפענוח הספקולטיבי?

הסביבה הנתמכת היא TensorRT-LLM בגרסה 1.1.0rc1 על מערכת הפעלה לינוקס, יחד עם קובץ הגדרות ייעודי עבור Eagle שמגדיר את אורך הטיוטה.

איך מריצים

אי אפשר להריץ את הקובץ הזה לבד, הוא דורש את מודל הבסיס gpt-oss-120b שכולל 120 מיליארד פרמטרים בארכיטקטורת תערובת מומחים. המפרט נבדק על חומרת Blackwell B200 בתוך סביבת TensorRT-LLM בגרסה 1.1.0rc1 תחת לינוקס, עם חלוקה של שמונה מעבדים גרפיים במקביל.

אם אין לכם קלאסטר כזה בהישג יד, אין מה להוריד את 411 המגה בייט האלה. במצב כזה עדיף לצרוך את המודל דרך ספקי ענן או ממשקי API חיצוניים במקום לשאת בעלויות של שרת ייעודי.

pip install -U huggingface_hub
hf download nvidia/gpt-oss-120b-Eagle3-long-context

הקבצים

6 קבצים במאגר, 411 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־nvidia-open-model-license ומפנה גם ל־Apache 2.0, כשהשימוש המסחרי והלא מסחרי מותר. אתם יכולים לשלב אותו במוצרים שלכם ולפרוס אותו באופן גלובלי, כל עוד עומדים בתנאי השימוש ובהגבלות שמפורטות בהסכם הרישוי המקורי של אנבידיה.

הרישיון המלא בעמוד המודל ↗