GPT
N

Nemotron-Instruction-Following-Chat-v1

קוד פתוח

nvidiacc-by-4.02025-12-14

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אנבידיה ארזה כאן מעל 400 אלף דוגמאות לשיחה, מעקב אחרי הוראות ופלט בפורמט ג'ייסון. זה מיועד למי שרוצה לאמן מודל לצ'אט בלי להסתבך עם רישיונות שימוש מגבילים.

  • 1,995הורדות בחודש
  • 130לייקים

מה זה

המאגר מורכב משני חלקים עיקריים שנועדו לשפר שיחה ומעקב אחרי מגבלות נוקשות. החלק הגדול מכיל 426,009 שיחות, חלקן בסיבוב בודד וחלקן רב סיבוביות. הבסיס נלקח מגרסה קודמת של אנבידיה וחודש באמצעות מודלים כמו GPT-OSS-120B וגרסאות של Qwen3-235B, כאשר מודל שפה שימש גם לסימולציה של המשתמש. כדי להבטיח איכות בהוראות מורכבות, החוקרים יישמו מתודולוגיה של Tülu 3 וסיננו את התוצאות באמצעות בודקים אוטומטיים של IFEval ושל IFBench, לצד שופט מבוסס מודל שזרק תשובות שעקבו אחרי ההוראות באופן שטחי בלבד.

החלק השני קטן בהרבה וכולל 4,969 דוגמאות שמתמקדות ביצירת פלט מובנה לפי סכמת ג'ייסון. הדוגמאות שם מגוונות בכוונה מבחינת רמת הקושי, כולל שינויים במיקום ההוראות בטקסט, ברמת המורכבות של הסכמה, ובסוגי המסמכים וההודעות שנמסרו למודל.

מתאים ל

  • אימון מודל שיחה רב סיבובי

    שיפור היכולת של מודל לנהל דיאלוג רציף באנגלית על בסיס שיחות מסוננות באיכות גבוהה.

  • חידוד מעקב אחר הוראות

    הטמעת דוגמאות שעברו סינון מחמיר של IFEval ושל IFBench להתמודדות עם אילוצים נוקשים.

  • הפקת פלט מובנה בג'ייסון

    אימון המודל להיצמד לסכמות נתונים מוגדרות מראש מתוך טקסטים חופשיים ומסמכים שונים.

איפה זה נופל

החומר כולו באנגלית בלבד. אם אתם בונים שירות בעברית, המאגר הזה לא ייתן מענה ישיר לשפה או להקשר ישראלי מקומי, ויידרש אימון נוסף. בנוסף, מדובר במידע שרובו הגדול סינתטי ומיוצר על ידי מודלי שפה, עם סינון מבוסס מודלים בעצמו. זה אומר שההטיות של מודלי הבסיס נכנסו פנימה. החלק של הפלט המובנה כולל פחות מחמשת אלפים דוגמאות, כמות קטנה מאוד ביחס לנפח הכללי, כך שלא כדאי להסתמך עליו בלבד לחילוץ ישויות מורכב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, אנבידיה מציינת במפורש שהנתונים מוכנים לשימוש מסחרי. החלק של הפלט המובנה ברישיון CC BY 4.0 וחלק השיחות ברישיון ODC-BY v1.0, כך ששניהם דורשים מתן ייחוס מתאים.

האם יש במאגר תמיכה בשפה העברית?

לא, המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. אם המוצר מיועד לקהל ישראלי, תצטרכו לשלב דאטהסטים נפרדים בעברית כדי להגיע לביצועים סבירים בשפה.

כמה שוקל הדאטהסט ואיך הוא בנוי?

הנפח הכולל בדיסק הוא כ 6.6 גיגה בייט. הוא מכיל כ 431 אלף רשומות בפורמט JSONL, שמתוכן מעל 426 אלף שייכות לשיחות וקרוב לחמשת אלפים מיועדות לפלט מובנה.

איך נאספו וסוננו הנתונים?

האיסוף משלב סימולציות ומודלים כמו GPT-OSS-120B וגרסאות Qwen3-235B לפי שיטת Tülu 3. הנתונים עברו אימות אוטומטי מול כלי בדיקה של IFEval ושל IFBench, וסינון נוסף בעזרת מודל שפסל תשובות שטחיות.

איך טוענים

המאגר שוקל כ 6.6 גיגה בייט בדיסק, מחולק לקובצי JSONL פשוטים בתוך תיקיית data, וזמין להורדה חופשית בלי תהליך אישור גישה. הוא מכיל טקסט ומטא דאטה. אם המטרה שלכם היא דיוק פורמלי במבנה נתונים ולא רק שיחה זורמת, מומלץ להפריד את structured_outputs.jsonl מ chat_if.jsonl כדי לשלוט ביחס הדגימה בזמן האימון, אחרת החלק המובנה פשוט ייבלע בגלל כמות הדוגמאות הנמוכה שלו.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Instruction-Following-Chat-v1")

הרישיון

המאגר מוצהר כמתאים לשימוש מסחרי, אך כולל שני רישיונות שונים. תת המאגר של הפלט המובנה פועל תחת CC BY 4.0, שדורש ייחוס בלבד. לעומת זאת, תת המאגר של השיחות כפוף לרישיון ODC-BY v1.0. המשמעות היא שמותר לאמן מודלים מסחריים ולהפיץ תוצרים, כל עוד מקפידים על מתן הקרדיט הנדרש לפי תנאי שני הרישיונות.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗