GPT
O

OpenReasoning-Nemotron-32B

קוד פתוח

nvidiacc-by-4.02025-07-15

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסת חשיבה עמוקה מבוססת Qwen שאימנה אנבידיה לפתרון בעיות תכנות, מדע ומתמטיקה תחרותית. היא מיועדת למי שצריך תוצאות ברמת פרונטיר מקומי בלי להחזיק שרת של 70B.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 662הורדות בחודש

מה זה

אנבידיה לקחה את Qwen2.5-32B וביצעה עליו אימון נוסף עם כחמישה מיליון תשובות שנלקחו מתוך DeepSeek-R1. המטרה כאן ממוקדת לגמרי: חילוץ שרשראות מחשבה מורכבות סביב תכנות, מתמטיקה ומדעים מדויקים, כולל תמיכה בפלט חריג של עד 64 אלף טוקנים לתשובה אחת.

במבחני ביצועים קשים המודל מציג זינוק חד מול מתחרים באותו משקל. במבחן AIME 2024 הוא מגיע לציון pass@1 של 89.2, ובשילוב שיטת הבחירה GenSelect מגיע ל־93.3. ב־LiveCodeBench הוא עומד על 70.2 ב־pass@1 ועולה ל־75.3 עם סינון פתרונות, נתונים שעוקפים מודלים קנייניים כבדים בהרבה ומראים שהאימון על שרשראות הסקת מסקנות ספציפיות אכן סיפק תוצאות חריגות.

מתאים ל

  • פתרון בעיות קוד מורכבות

    מייצר פתרונות אלגוריתמיים ארוכים בפייתון עם ציון 70.2 ב־LiveCodeBench.

  • עוזר מחקר במתמטיקה

    מנתח הוכחות ומשוואות תחרותיות ומגיע ל־89.2 במבחני AIME.

  • סינון פתרונות אוטונומי

    מפעיל את מנגנון GenSelect כדי לייצר מספר מסלולי חשיבה ולבחור את הטוב מתוכם.

איפה זה נופל

האימון התבסס אך ורק על למידה מונחית, SFT, ללא reinforcement learning ישיר לפירוק שלבי הסקת מסקנות. הכרטיס מציין אנגלית בלבד, כך שבלי בדיקה קפדנית לא מומלץ להסתמך עליו בעברית. מעבר לכך, במבחן המדע הקשה Humanity's Last Exam המודל קיבל ציון נמוך מאוד של 11.9, נתון שמבהיר שבעיות ידע קיצוניות שלא דומות לדאטה הקיים עדיין מכשילות אותו. כיוון שהוא מייצר עד 64 אלף טוקנים, זמן ההמתנה לתשובה גבוה במיוחד ועלול לגרור צווארי בקבוק חריפים במערכות זמן אמת.

אותה משפחה

OpenReasoning-Nemotron יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. המודל מבוסס על Qwen שמכיל ידע רב לשוני מסוים, אך כל כוונון ההסקה נעשה באנגלית, כך שפניות בעברית עלולות להוריד משמעותית את איכות הלוגיקה והקוד.

למה התשובות לוקחות הרבה זמן לייצור?

המודל מאומן לפלוט עד 64 אלף טוקנים הכוללים שרשרת חשיבה מפורטת ומלאה. זה לא כלי לצ'אט מהיר, אלא מנוע חישוב שמייצר טקסט ארוך לפני שהוא מחזיר תשובה סופית.

איך מריצים

המשקל הגולמי של הקבצים עומד על 61 ג'יגה בייט בפורמט bfloat16. כדי לטעון אותו כמו שהוא ולהשאיר מקום לקונטקסט ולפלט המאסיבי, תצטרכו כרטיס H100 בודד של 80GB, בדיוק החומרה שבה השתמשו אנבידיה לבדיקות, או שני כרטיסי A100 או RTX 4090 אם אתם משתמשים בכימות של 4 ביט.

מי שרוצה להריץ אותו בהפקה יעדיף ספריות כמו vLLM או TensorRT-LLM על פני transformers הרגיל. אם אין לכם גישה למאיצים ייעודיים של אנבידיה בארכיטקטורת Ampere או Hopper, העלות והאיטיות של הפקת עשרות אלפי טוקני מחשבה הופכות הרצה עצמאית לחסרת היגיון מול API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/OpenReasoning-Nemotron-32B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון קוד פתוח של Creative Commons מסוג CC-BY-4.0, יחד עם הפניה לרישיון Apache 2.0 של מודל הבסיס. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים או מחקריים, לשנות אותו ולשלב אותו במוצרים, בתנאי שנותנים קרדיט מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗