GPT
N

Nemotron-SFT-Instruction-Following-Chat-v3

קוד פתוח

nvidiaodc-by,cc-by-4.0,apache-2.0,other2026-05-26

  • chat
  • instruction-following
  • supervised-fine-tuning
  • sft
  • synthetic

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר מרכז 887 אלף דוגמאות אימון באנגלית לשיחות מרובות תורות ולמילוי הוראות מדויק. הוא מתאים למי שרוצה לאמן מודל שיחה ומחפש תגובות ספציפיות שסוננו באמצעות מודל שיפוט.

  • 7,695הורדות בחודש
  • 19לייקים

מה זה

הנתונים מחולקים לשני קבצים עיקריים בפורמט JSONL. חלק השיחות מכיל 637 אלף דוגמאות ונבנה סביב פרומפטים אנושיים ממאגרים כמו lmsys-chat-1m ו־WildChat-1M. התשובות נוצרו באמצעות GLM-5, נדגמו בכמה גרסאות, ומודל שיפוט בשם Qwen3-Nemotron-235B-A22B-GenRM-2603 בחר את הטובה ביותר. הרחבת השיחה לתורות נוספים נעשתה גם היא בסימולציה עם GLM-5, אך שם נבחרה בכוונה תגובה אקראית כדי לבנות עמידות, ולכן רק התור האחרון של העוזר מיועד לאימון.

חלק מילוי ההוראות כולל 249 אלף דוגמאות ונוצר עם GPT-OSS-120B במאמץ בינוני. הוא משלב פרומפטים מתוך tulu-3-sft-personas-instruction-following לצד הצינור ששימש בגרסה הקודמת של המאגר. שתי החלוקות כוללות שדות תוכן רגילים לצד שדות מחשבה ונימוק בשם reasoning_content, שניתן להסיר אם רוצים לאמן מודל שאינו מייצר תהליכי חשיבה.

מתאים ל

  • אימון SFT למודלי שיחה

    שיפור היכולת של מודלים להתמודד עם שיחות רב שלביות על ידי אימון על תור הסיום שנבחר באמצעות מודל שיפוט.

  • אימון למילוי הוראות מדויק

    כוונון עדין על 249 אלף דוגמאות סינתטיות שנבנו סביב מעקב אחר פקודות מורכבות ופרסונות.

  • אימון מודלים ללא שלב חשיבה

    שימוש ברשומות לאחר מחיקת שדה ה־reasoning_content כדי לקבל תגובות ישירות וקצרות בלי פלט ביניים.

איפה זה נופל

הדאטהסט מוגבל לאנגלית בלבד, ואין בו תמיכה בשפות אחרות או בעברית. חיסרון משמעותי נמצא בחלק השיחות: אנבידיה לא הפיצה מחדש את פרומפט הפתיחה של המשתמש וההודעה המקדימה עבור שורות שמקורן במאגרי צד שלישי, והם מופיעים כערכי null. כדי להשתמש בהן במלואן תצטרכו להריץ סקריפט שחזור מקומי שדורש הרשאות גישה חיצוניות למאגר lmsys.

בנוסף, חלק השיחות לא נבנה לאימון מלא של כל השלבים. החוקרים מציינים מפורשות שרק התור האחרון של העוזר בכל שיחה מתאים לחישוב הלוס, מכיוון שהתורות הקודמים הורחבו על בסיס תשובות אקראיות ולא על בסיס התשובה המיטבית.

אותה משפחה

Nemotron-SFT-Instruction-Following יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, לפי התיעוד המאגר מוכן לשימוש מסחרי ולא מסחרי תחת רישיונות CC BY 4.0 ו־ODC-By. עם זאת, אם אתם מריצים את סקריפט השחזור כדי למלא פרומפטים חסרים, תצטרכו לוודא שאתם עומדים גם בתנאי הרישוי של מאגר המקור lmsys.

האם יש במאגר שיחות בעברית?

לא. הדאטהסט מקוטלג באנגלית בלבד וכל הנתונים שנוצרו בו מתבססים על הנחיות ומודלים באנגלית. אם אתם מכוונים למוצר בעברית, תצטרכו לתרגם אותו או להשתמש בו רק כבסיס כללי ליכולות שיחה.

למה חלק מהפרומפטים מופיעים בתור null?

אנבידיה החליטה לא להפיץ מחדש פרומפטים שמקורם במאגרי צד שלישי כמו WildChat ו־lmsys כדי להימנע מהפצה חוזרת של נתוני המקור. כדי לקבל את הטקסט המלא, אתם צריכים להריץ את הסקריפט המצורף יחד עם טוקן שמורשה לגשת למאגרים אלה.

האם אפשר לאמן את המודל על כל תורות השיחה?

החוקרים מדגישים שלא. השיחות הורחבו באופן סינתטי מתוך תגובות שנדגמו באקראי ולא מהתגובות הטובות ביותר, ולכן רק התור האחרון של העוזר בכל שיחה מסונן ומיועד לשמש כדוגמת אימון.

איך טוענים

המאגר שוקל 19 גיגה בייט בסך הכל, מתוכם 16 גיגה לקובץ השיחות ו־3 גיגה לקובץ ההוראות, והוא מגיע כטקסט פשוט בפורמט JSONL. הטעינה נעשית ישירות מהקבצים data/chat.jsonl ו־data/instruction_following.jsonl. אם תרצו לשחזר את הפרומפטים החסרים בקובץ השיחות, תצטרכו להגדיר טוקן גישה להאגינג פייס שמאושר למאגר lmsys-chat-1m, ולהריץ את הסקריפט prepare_chat_prompts.py ששומר קובץ משוחזר.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-SFT-Instruction-Following-Chat-v3")

הרישיון

המאגר מוגדר לשימוש מסחרי ולא מסחרי תחת הרישיונות CC BY 4.0 ו־ODC-By, לצד תיוג של apache-2.0 ו־other במטא-דאטה. מותר לאמן עליו מודלים, לשנות אותו ולהפיץ תוצרים, בתנאי שנותנים קרדיט מתאים ליוצרים. שימו לב ששחזור הפרומפטים החסרים דרך המאגרים החיצוניים כפוף גם לתנאי השימוש של אותם מקורות.

הרישיון המלא ב־Hugging Face ↗