GPT
N

Nemotron-Personas-India

קוד פתוח

nvidiacc-by-4.02025-10-13

  • synthetic
  • personas
  • NVIDIA
  • Hindi
  • Devanagari

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שלושה מיליון רשומות של פרסונות סינתטיות שנבנו לפי מפקד האוכלוסין של הודו, באנגלית ובהינדי. הוא מתאים למי שמאמן מודלים ומחפש גיוון דמוגרפי מדויק במקום פרומפטים מערביים שטחיים.

  • 1,257הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל שלושה מיליון רשומות, המחולקות שווה בשווה בין אנגלית, הינדי בכתב דוונגארי והינדי בתעתיק לטיני. כל רשומה מייצרת שבעה תיאורי פרסונה שונים, ובסך הכל עשרים ואחד מיליון תיאורים. המבנה מורכב מעשרים ושבע שדות נתונים, כולל שבעה שדות פרסונה טקסטואליים ועשרים שדות הקשר דמוגרפיים שמתארים גיל, אזור גאוגרפי, מצב משפחתי, השכלה ומקצוע.

הנתונים מבוססים על פילוחים סטטיסטיים ממפקד האוכלוסין של הודו משנת 2011 ומפנקסי בוחרים מקומיים שפורסמו דרך הרווארד. אנבידיה יצרה את הטקסט באופן סינתטי באמצעות מודל הסתברותי יחד עם מודל השפה GPT-OSS-120B במסגרת כלי NeMo Data Designer. השמות עצמם הוטמעו בתוך הטקסט שנוצר, אך השדות של שמות פרטיים, שמות משפחה, דת וכתובות מלאות הוסרו מהגרסה הפומבית.

מתאים ל

  • ייצור שיחות מגוונות

    יצירת שיחות צ'אט סינתטיות מרובות תורות שנשענות על רקע תרבותי, שפה ותעסוקה אותנטיים.

  • אימון מודלים מותאמי הודו

    אימון מודלי שפה אזוריים עם חלוקה דמוגרפית שנשענת על נתוני מפקד אמיתיים.

  • מניעת קריסת מודלים

    הרחבת נתוני פרומפט בעזרת 560 אלף שמות וכ־3,000 מקצועות לצמצום חזרתיות בייצור נתונים.

איפה זה נופל

הבסיס הדמוגרפי נשען על מפקד אוכלוסין מ־2011, פער של למעלה מעשור שבו הודו השתנתה משמעותית. בנוסף, מודל היצירה הניח הנחות עצמאות סטטיסטית, כמו ההנחה שמשלח היד אינו תלוי ברמת ההשכלה עבור גיל ואזור נתונים. קטינים מתחת לגיל 18 לא נכללים כאן כלל. המאגר מכיל אנגלית והינדי בלבד, ואין בו שום ייצוג לעברית או להקשרים מקומיים ישראליים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, המאגר זמין תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור לאנבידיה בהתאם לתנאי הרישיון.

האם יש במאגר טקסטים בעברית?

לא. המאגר מוגבל אך ורק לאנגלית ולהינדי בשני סוגי כתב, דוונגארי ולטיני. אם המטרה היא אימון או הערכה עבור משימות בעברית, המאגר אינו מתאים ללא תרגום.

איך נוצרו הפרסונות אם מדובר במידע מומצא?

הנתונים הדמוגרפיים מבוססים על מפקד האוכלוסין של הודו משנת 2011 ומאגר שמות מפנקס הבוחרים. אנבידיה שילבה מודל הסתברותי גרפי עם מודל השפה GPT-OSS-120B כדי לחולל תיאורי חיים התואמים לסטטיסטיקה האמיתית.

מה ההבדל בינו לבין מאגרי פרסונות אחרים?

מרבית מאגרי הפרסונות נשענים על פרומפטים פשוטים שנוטים לייצג בעיקר אוכלוסייה מערבית, עירונית וצעירה. המאגר הזה מייצג במכוון חתכי גיל מבוגרים, אוכלוסייה כפרית ומגוון מקצועות רחב שמבוסס על סיווג העיסוקים הלאומי של הודו.

איך טוענים

הנתונים שמורים בקובצי Parquet המחולקים למקטעים, כמו קובצי en_IN מרובי חלקים מתוך 61 קבצים בסך הכל במאגר. הגישה חופשית לגמרי ואינה דורשת אישור ידני או חתימה על תנאי שימוש מיוחדים מול המערכת של Hugging Face. כדי לעבוד איתו בצורה ממוקדת, מומלץ לסנן לפי 20 עמודי ההקשר הדמוגרפיים לפני ששולפים את תיאורי הפרסונה באנגלית או בהינדי.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-India")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. המשמעות היא שמותר להשתמש בו לצרכים מסחריים ומחקריים כאחד, לשנות אותו, ולאמן עליו מודלים חופשיים או מסחריים, כל עוד נותנים קרדיט ראוי למפרסם המקורי בהתאם לדרישות הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗