GPT
N

Nemotron-SFT-Instruction-Following-Chat-v2

קוד פתוח

nvidiaodc-by2026-03-08

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר שיחות סינתטי שנועד לשפר מעקב אחר הוראות ודיאלוג פתוח במודלי שפה. הוא מציע שדרוג לגרסה הראשונה עם תשובות ממודלים חזקים ומודרניים, ופתוח לשימוש מסחרי ישיר.

  • 4,861הורדות בחודש
  • 29לייקים

מה זה

המאגר כולל קרוב לשני מיליון רשומות שיחה בפורמט טקסט ומטא-דאטה, ומיועד לאימון SFT על משימות שיחה ומעקב מדויק אחר הוראות. מדובר בגרסה מעודכנת של הדאטהסט הקודם בסדרה, שנבנתה כדי לרענן את איכות התשובות והסגנון של המודל.

איסוף המידע והתיוג הוגדרו כהיברידיים, שילוב של מגע אנושי, יצירה סינתטית ותהליכים אוטומטיים. השיחות הסינתטיות עצמן הופקו משורה של מודלים מובילים, כולל מודלי חשיבה כמו Kimi-K2-Thinking, Qwen3-235B-A22B-Thinking ודגמי הוראות כמו GLM-4.6 ו־GPT-OSS-120b.

התוכן מחולק לקבצי JSONL שמפרידים בין מצבים שונים, כמו קובץ ייעודי למצבי חשיבה פעילים reasoning_on וקובץ שבו החשיבה כבויה reasoning_off, מה שמאפשר לברור בדיוק איזה סגנון פלט תרצו להזריק למודל.

מתאים ל

  • אימון הוראות ומענה

    כוונון עדין למודלי בסיס שצריכים להבין הנחיות מורכבות ולענות בשיחה חופשית.

  • אימון מודלי חשיבה

    שימוש בקובץ reasoning_on כדי ללמד מודל לפרט שלבי מחשבה לפני התשובה.

  • הערכת ביצועי שיחה

    מבחן ביצועים לבדיקת יכולת המודל לעקוב אחרי הוראות פתוחות באנגלית.

איפה זה נופל

הנתונים כולם באנגלית בלבד. מי שבונה מודל ייעודי לעברית לא יקבל פה שום כיסוי שפתי או תרבותי, ויצטרך להסתמך על זה רק כבסיס כללי ליכולות שיחה. בנוסף, מדובר בדאטה שנשען בכבדות על טקסט סינתטי ממודלים אחרים, כך שההטיות, שגיאות ההיגיון והסגנון של אותם מודלי מקור נכנסים ישירות פנימה. אנבידיה מבהירה שהבדיקה וההתאמה לתעשייה שלכם היא באחריותכם, ולפני שרצים למוצר סופי צריך לסנן דליפות והזיות.

אותה משפחה

Nemotron-SFT-Instruction-Following יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא ODC-By ואנבידיה מצהירה במפורש שהוא מוכן לשימוש מסחרי. החובה המרכזית שלכם היא להעניק קרדיט וייחוס לפי תנאי הרישיון. המודלים שאימנתם על הדאטה לא מחויבים ברישיון פתוח.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר מסווג ומוגדר באנגלית בלבד. כל הטקסטים והשיחות נוצרו על בסיס מודלים בשפה זו. כדי להשתמש ביכולות שלו בארץ, תצטרכו לשלב אותו עם נתוני הדרכה מקומיים בעברית.

כמה מקום צריך בשבילו בדיסק?

המשקל הכולל של הקבצים עומד על כ־15 גיגה-בייט. הוא כולל כמעט שני מיליון שיחות בפורמט JSONL, כך שמדובר בנפח נוח מאוד להורדה ולעיבוד גם בתחנות עבודה רגילות.

איך המידע הזה נוצר בפועל?

זהו אוסף היברידי שנשען על שיחות סינתטיות שיוצרו על ידי שורת מודלים מתקדמים, כולל מודלים של Qwen, Kimi, GLM ו־OpenAI. התהליך כלל גם התערבות אנושית וסינון אוטומטי, והוא מחולק לפי שיחות עם וללא תהליכי חשיבה מפורשים.

איך טוענים

הנתונים מגיעים בקובצי JSONL במשקל כולל של כ־15 גיגה-בייט בדיסק, כך שלא צריך תשתית ענקית רק כדי לפרוק אותם. הגישה למאגר פתוחה לחלוטין בהורדה ישירה מחשבון אנבידיה בלי צורך בטופסי הרשמה או בקשות אישור מראש. בקוד תצטרכו להתמקד בעיקר בקובצי הנתונים המרכזיים שמפרידים את תהליכי ההסקה, כדי לטעון נכון את השיחה והמטא-דאטה לפי פורמט האימון שלכם.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-Instruction-Following-Chat-v2")

הרישיון

המאגר משוחרר תחת רישיון ODC-By. מותר להשתמש בו לאימון מודלים, למחקר ולהערכה, כולל פיתוח מוצרים מסחריים מלאים. התנאי המרכזי הוא מתן ייחוס מתאים לאנבידיה לפי דרישות הרישיון, אך אין חובה לשתף את המודל המאומן שלכם באותו הרישיון.

הרישיון המלא ב־Hugging Face ↗