GPT
N

Nemotron-Cascade-14B-Thinking

קוד פתוח

nvidiaother2025-12-08

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת חשיבה מבוססת Qwen3 עם 15 מיליארד פרמטרים, שמביאה ביצועי תכנות חריגים לגודל שלה ועוקפת במבחני קוד מודלים עצומים.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 31.5 GBמשקל הקבצים
  • 5,001הורדות בחודש

מה זה

מדובר במודל שפותח על בסיס Qwen3-14B Base ועבר אימון חיזוקים מדורג וממוקד תחומים מבית אנבידיה. הוא בנוי לעבוד אך ורק במצב חשיבה, ומייצר שרשרת מחשבה לפני שהוא פולט את התשובה הסופית. המטרה כאן ברורה, מקסימום יכולת הסקת מסקנות ופתרון בעיות מורכבות בלי להחזיק מפלצת של מאות מיליארדי פרמטרים.

במבחני תכנות תחרותיים כמו LiveCodeBench v5 ו־v6 הוא רושם 77.5 ו־74.6 בהתאמה, ועוקף שם גם את DeepSeek-R1-0528 הענק שמחזיק 671 מיליארד פרמטרים. גם במתמטיקה התוצאות חזקות עם 89.7 ב־AIME 2024. הוא לא מוביל בכל הגזרות, אבל בפתרון בעיות אלגוריתמיות וקוד נקודתי מדובר ברמת דיוק חריגה ביחס למשקל שלו.

מתאים ל

  • פתרון בעיות קוד קשות

    מצטיין באלגוריתמיקה תחרותית ובדיקות קוד נקודתיות, עם תוצאות שעוקפות מודלים גדולים בהרבה.

  • פתרון בעיות מתמטיות

    מתאים למשימות חישוב והוכחה מורכבות תודות לציון 89.7 במבחני AIME 2024.

  • בדיקת וניתוח לוגיקה מקומית

    מאפשר הרצה של מודל חשיבה מתקדם על חומרה מקומית בלי לשלוח מידע רגיש לשירותי ענן.

איפה זה נופל

ההתמקדות בקוד ובמתמטיקה גבתה מחיר במקומות אחרים. במעקב אחרי הוראות מורכבות תחת בדיקה קפדנית הוא מקבל 81.9 ב־IFEval, נמוך יותר מגרסת הבסיס שעומדת על 85.4. גם ביכולות הפעלת כלים המודל השיג 67.5 במבחן BFCL V3, ירידה מול מודל הבסיס שמגיע ל־70.4.

הוא מוגדר לשפה האנגלית בלבד, ואין לו מצב פעולה רגיל ללא חשיבה. מעבר לזה, במשימות תוכנה רחבות בעולם האמיתי כמו SWE Verified הוא נעצר ב־43.1, מרחק ניכר ממודלים גדולים יותר.

אותה משפחה

Nemotron-Cascade יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו בלי מצב חשיבה לתשובות מהירות?

לא. המודל תוכנן לעבוד אך ורק במצב חשיבה ודורש תגית ייעודית בכל פנייה. בשיחות מרובות שלבים אנבידיה מנחה להחזיר להיסטוריה רק את הסיכום הסופי כדי לחסוך טוקנים, אבל תהליך ההסקה עצמו תמיד יכלול את שלב המחשבה.

איך מרחיבים את חלון ההקשר מעבר ל־32K טוקנים?

מעדכנים את קובץ ההגדרות שלו עם מנגנון YaRN RoPE scaling. אנבידיה ממליצה על פקטור 2.0 למרבית המשימות עד 64 אלף טוקנים, ועל פקטור 3.0 במשימות הנדסת תוכנה כדי להגיע ל־90 אלף טוקנים.

איך מריצים

המשקל הגולמי של הקבצים עומד על 31.5 גיגה בפורמט bfloat16, מה שאומר שבשביל להריץ אותו כמו שהוא צריך כרטיס עם לפחות 40 גיגה זיכרון גרפי, למשל A100 או זוג כרטיסים צרכניים חזקים. הקבצים מגיעים מחולקים ל־185 חלקים ודורשים סביבת transformers סטנדרטית.

ברירת המחדל של חלון ההקשר היא 32,768 טוקנים, אבל אנבידיה ממליצה להשתמש ב־YaRN RoPE scaling עם פקטור 2.0 כדי להגיע ל־64 אלף טוקנים, או פקטור 3.0 כדי לדחוף ל־90 אלף טוקנים במשימות הנדסת תוכנה. צריך להגדיר טמפרטורה של 0.6 ו־top_p של 0.95, ולהקפיד להדביק את התגית הייעודית בסוף קלט המשתמש כדי להפעיל את מנגנון החשיבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Cascade-14B-Thinking")
print(pipe("שלום"))

הקבצים

185 קבצים במאגר, 31.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model License ולא לרישיון קוד פתוח סטנדרטי. הרישיון מסווג במאגר כחריג, ולכן לפני הטמעה במערכות פנימיות או שילוב במוצר מסחרי חובה לקרוא את התנאים המשפטיים המלאים של אנבידיה ולוודא שהשימוש המתוכנן עומד בהגבלות שלהם.

הרישיון המלא בעמוד המודל ↗