GPT
F

fineinstructions_nemotron

קוד פתוח

fineinstructionsרישיון לא דווח2025-07-29

מעל מיליארד זוגות סינתטיים של הוראה ותשובה שנבנו ישירות מתוך טקסטים של אימון מקדים. הוא נועד למי שבונה מודל ורוצה כוונון עדין בהיקף ענק בלי לאסוף דאטה ידנית.

  • 3,036הורדות בחודש
  • 27לייקים

מה זה

המאגר כולל כמיליארד זוגות של הוראות ותשובות סינתטיות, שמסתכמות בכשלוש מאות מיליארד טוקנים. הנתונים נוצרו באמצעות תהליך אוטומטי שרץ על מסמכי מקור מתוך Nemotron-CC, שהוא תת קבוצה של מסמכים באיכות גבוהה מתוך CommonCrawl ששימשו לאימון מקדים.

המבנה של המאגר מחולק לקבצי מידע בפורמט פרקט לצד קבצי ג'ייסון מקבילים. לכל קובץ פרקט יש קובץ שיפוט תואם שמכיל הערכה אוטומטית של איכות הזוגות, בסולם ליקרט שנע בין אחת לחמש, כאשר חמש מייצג את האיכות הגבוהה ביותר. התהליך הזה מאפשר לסנן את החומר לפי רמת האיכות הנדרשת עוד לפני שלב האימון עצמו.

מתאים ל

  • אימון מקדים מונחה

    שילוב מיליארדי הוראות סינתטיות ישירות בשלבי האימון הראשוניים של מודלי שפה.

  • סינון לפי איכות

    בחירת דוגמאות אימון ספציפיות שמחזיקות בציון שיפוט חמש מתוך קבצי הג'ייסון.

  • מחקר על דאטה סינתטי

    בדיקת השפעת השימוש בהוראות מיוצרות במכונה על ביצועי המודל באנגלית.

איפה זה נופל

כל הטקסטים כאן נוצרו באופן סינתטי ומבוססים על אנגלית בלבד, כך שאין כאן מענה לשפות אחרות או לעברית. בנוסף, מדובר בהערכה אוטומטית בלבד של איכות הנתונים ולא בבדיקה אנושית. אם אתם מכוונים למוצר סופי, יש סיכון מובנה של חזרתיות או שגיאות שהמודל המייצר הכניס פנימה בלי שתדעו מראש.

שאלות
נפוצות

האם מותר להשתמש בו לצרכים מסחריים?

לא פורסם רישיון עבור המאגר הזה. מבחינה משפטית זה אומר שאין לכם היתר שימוש ברור, ולכן לא מומלץ לבנות עליו מוצר מסחרי בלי אישור מפורש מיוצריו.

האם יש במאגר נתונים בעברית?

המאגר מתועד באנגלית בלבד ונוצר ממסמכי אינטרנט בשפה הזו. אין בו תמיכה ייעודית בעברית, כך שהוא לא יעזור למי שמחפש לשפר ביצועים מקומיים.

איך נאספו הנתונים שבפנים?

הטקסטים נוצרו בצורה סינתטית לחלוטין מתוך מסמכי אימון מקדים של Nemotron-CC, שנלקחו במקור מ־CommonCrawl. לאחר מכן הופק ציון שיפוט אוטומטי לכל הוראה ותשובה כדי לאמוד את איכותן.

איך טוענים

טוענים אותו ישירות דרך ספריית הדאטהסטים מתוך הנתיב הרשמי, אך קחו בחשבון שיש כאן 3,821 קבצים וסדר גודל של שלוש מאות מיליארד טוקנים. הנתונים מאוחסנים בפורמט פרקט, ולצדם קבצי שיפוט במבנה ג'ייסון. אין צורך באישור גישה מיוחד כדי להוריד, אך השדה החשוב ביותר לעבודה הוא ציון השיפוט שנמצא בקבצי הג'ייסון, שבלעדיו תתקשו לדעת איזה חלק מהדאטה איכותי מספיק.

from datasets import load_dataset

ds = load_dataset("fineinstructions/fineinstructions_nemotron")

הרישיון

היוצרים לא הגדירו רישיון בכרטיס המאגר. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל פעולה של אימון או הפצה של מודל שנבנה עליו עלולה להיתקל בבעיה משפטית. מומלץ לבדוק ישירות מול החוקרים שפרסמו אותו לפני שמשלבים אותו במערכות ייצור.

הרישיון המלא ב־Hugging Face ↗