GPT
O

OpenReasoning-Nemotron-7B

קוד פתוח

nvidiacc-by-4.02025-07-15

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שדרוג ממוקד חשיבה לקוון שמביא יכולות פתרון מתמטיקה וקוד של מודלי ענק למשקל שרץ על כרטיס בודד. הוא נבנה כדי לפלוט שרשראות חשיבה ארוכות במיוחד במחיר חישובי נגיש.

  • 7.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 2,967הורדות בחודש

מה זה

מדובר בהתאמה של קוון 2.5 בגודל שבעה מיליארד פרמטרים, שאומן ישירות על שרשראות חשיבה סינתטיות שנלקחו מדיפסיק אר אחת. המטרה כאן ממוקדת לגמרי: פתרון בעיות במדעים, כתיבת קוד תחרותי ומענה על שאלות מתמטיות קשות, כשהוא מסוגל לפלוט תגובות באורך של עד שישים וארבעה אלף טוקנים.

במבחני ביצועים התוצאות מראות יתרון ברור על פני מודלים רגילים בגודל הזה. הוא מגיע לציון של שמונים וארבעה נקודה שבע בבחינת איימי עשרים וארבע, ומעל שישים ושלושה אחוזים במבחני קוד חיים, מספרים ששמורים בדרך כלל למודלים ששוקלים פי כמה ממנו. כשמריצים כמה דגימות במקביל ובוחרים פתרון בשיטת ג'ן-סלקט, הוא אף חוצה את רף התשעים אחוזים במתמטיקה.

מתאים ל

  • פתרון בעיות קוד תחרותי

    הוא מותאם ספציפית למעבר על שלבי אלגוריתמים מורכבים ופולט ישירות פתרונות בפייתון לפי פורמט מוגדר.

  • חישוב ומענה מתמטי

    מציג שרשרת חשיבה מלאה ברמת תחרויות אולימפיאדה, עם מעל שמונים וארבעה אחוזי הצלחה במבחן איימי.

  • אימות פתרונות במקביל

    מאפשר הרצה של מספר דגימות ובחירת התשובה הנכונה בעזרת מנגנון ייעודי שמקפיץ את הדיוק למובילים בתחום.

איפה זה נופל

המודל אומן אך ורק באמצעות כוונון מונחה ולא עבר שלבי חיזוק מתקדמים, מה שמגביל אותו לחשיבה לפי תבניות מוגדרות מראש. במבחן המדעי הקשה אייץ'-אל-אי הוא מקבל שמונה נקודה שלוש בלבד, כלומר כשהבעיה דורשת הבנה רחבה ולא רק מניפולציה מתמטית, הוא מתקשה מאוד.

בנוסף, הוא מוגדר רשמית רק באנגלית ולא מיועד לשיחה כללית, סיכום טקסטים או עבודה בעברית. שימוש בפלט ארוך כל כך גם גורר זמני תגובה איטיים להחריד, מה שלא מתאים ליישומים שדורשים מענה מיידי למשתמש קצה.

אותה משפחה

OpenReasoning-Nemotron יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה ופתרון שאלות בעברית?

הכרטיס מציין אנגלית בלבד, וכל מאגרי האימון של הקוד והמתמטיקה נבנו באנגלית. הוא אומנם מבוסס על קוון שמכיר שפות נוספות, אבל שימוש בעברית יפגע בדיוק החשיבה ולא נבדק על ידי היצרן.

למה שהפלט ייקח כל כך הרבה זמן בהרצה מקומית?

המודל מתוכנת לחשוב בפירוט ולייצר שרשראות הסבר ארוכות שיכולות להגיע עד שישים וארבעה אלף טוקנים. אם לא תגבילו את כמות הטוקנים המקסימלית בהגדרות, תמתינו דקות ארוכות לכל תשובה.

איך מריצים

המשקל הגולמי תופס קצת מעל ארבעה עשר גיגה בייט בזיכרון, כך שכרטיס מסך בודד של עשרים וארבעה גיגה בייט מחזיק אותו ללא קוונטיזציה. אנבידיה ממליצה על ארכיטקטורת אמפר או הופר בסביבת לינוקס, יחד עם מנועי הרצה דוגמת וי-אל-אל-אם או טנסור-אר-טי כדי להתמודד עם קצב ייצור הטוקנים הגבוה.

אם אתם מתכננים לנצל את יכולת החשיבה המלאה שלו ולהגיע לעשרות אלפי טוקנים של פלט, תצטרכו שרת עם כרטיס מקצועי כמו שמונים גיגה בייט כדי למנוע קריסות זיכרון בהקשרים ארוכים. במקרים שבהם אין לכם תשתית כזו זמינה, שירותי אירוח חיצוניים שמחייבים לפי שימוש יהיו זולים ופשוטים יותר לתחזוקה שוטפת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/OpenReasoning-Nemotron-7B")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון קריאייטיב קומונס ייחוס ארבע אפס, יחד עם הפניה לרישיון אפאצ'י שתיים של מודל הבסיס. זה מתיר שימוש מסחרי ומחקרי חופשי, כולל שינוי והפצה, כל עוד אתם נותנים קרדיט מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗