GPT
N

Nemotron-Personas-USA

קוד פתוח

nvidiacc-by-4.02025-06-09

  • synthetic
  • personas
  • NVIDIA
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מיליון רשומות של פרסונות סינתטיות המבוססות על נתוני מפקד האוכלוסין האמריקאי. מתאים למי שרוצה לגוון דאטה סינתטי ולמנוע קריסת מודלים בלי להיגרר לפילוח גילאים שטוח של מודלי שפה רגילים.

  • 3,225הורדות בחודש
  • 346לייקים

מה זה

המאגר כולל מיליון רשומות המחזיקות ששה מיליון תיאורי פרסונות וסך הכל כמעט מיליארד טוקנים. כל שורה מורכבת מ־22 עמודות, שש מתוכן הן שדות של הפרסונה עצמה והשאר שדות הקשר שכוללים מיקום גיאוגרפי, גיל, השכלה, מקצוע ומצב משפחתי. המידע הגיאוגרפי מכסה כ־29 אלף אזורי מיקוד ו־15.2 אלף ערים בכל 50 המדינות בארצות הברית, לצד פורטו ריקו ואיי הבתולה.

אנבידיה לא נתנה למודל שפה להמציא אנשים מאפס. הנתונים נשענים על סקר הקהילה האמריקאית של לשכת מפקד האוכלוסין של ארצות הברית בשילוב מחקר של רוזנמן מ־2023 על תפוצת שמות משפחה ומוצא. הנתונים הסטטיסטיים הללו הוזנו למודל גרפי הסתברותי, ומשם יוצרו הטקסטים בעזרת מודל קוד פתוח של open-ai בשם gpt-oss-120b דרך כלי הנתונים של אנבידיה. אין כאן חלוקה מובנית לסט אימון ומבחן אלא קבצי רכבת בלבד, והרשומות מוגבלות לאוכלוסייה בוגרת בלבד ללא קטינים.

מתאים ל

  • גיוון דאטה סינתטי

    יצירת פרומפטים מגוונים למודלי שפה לפי התפלגות גילאים והשכלה אמיתית במקום התפלגות פעמון אחידה.

  • הערכת הטיות במודלים

    בדיקת התנהגות מודל שפה מול 560 מקצועות שונים ופילוחים גיאוגרפיים בארצות הברית.

  • אימון סוכני שיחה

    לימוד מודלים לאמץ סגנונות דיבור ורקע סוציו אקונומי שונים לפי שדות ההקשר המצורפים.

איפה זה נופל

המאגר מוגבל לארצות הברית בלבד, כולו באנגלית, ואינו רלוונטי למי שמחפש מידע על שוק מקומי או נתונים בעברית. מעבר לכך, היוצרים מודים בהנחות אי-תלות סטטיסטיות שלא תמיד עומדות במציאות, למשל ההנחה שמשלח יד אינו תלוי במיקוד הגיאוגרפי אם מבודדים השכלה, גיל ומין. בנוסף, המאגר מסתמך על חלוקה למין בלבד כי מפקד האוכלוסין אינו מספק נתונים על מגדר, שמות וכתובות סינתטיות מלאות הושמטו, ופרסונות שרלוונטיות לתעשיות מוסדרות כמו פיננסים ובריאות נחתכו החוצה ושמורות למוצר המסחרי של אנבידיה.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר כולו באנגלית ומבוסס על נתוני דמוגרפיה של ארצות הברית, ללא ייצוג לשפות אחרות או לאוכלוסייה מקומית בישראל.

מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא, כולל אימון מודלים סגורים. צריך רק לוודא שנותנים קרדיט ליוצרים לפי תנאי הרישיון.

מה הנפח של הקבצים ואיך הם מגיעים?

הדאטהסט שוקל כ־2.6 ג'יגה בייט בסך הכל. הוא מחולק ל־11 קבצי parquet שנטענים דרך hugging face או ישירות בספריית datasets בפייתון.

האם מופיעים שם פרטים של אנשים אמיתיים?

לא, כל הטקסטים נוצרו בצורה סינתטית על ידי מודל שפה. הם מבוססים על סטטיסטיקה של מפקד האוכלוסין ושמות נפוצים ממחקר אקדמי, אך הדמויות עצמן מומצאות.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפקודה load_dataset("nvidia/Nemotron-Personas-USA"). אין צורך בבקשת גישה מיוחדת או אישור מקדים, המאגר פתוח להורדה ישירה. נפח האחסון הכולל עומד על 2.6 ג'יגה בייט והקבצים שמורים בפורמט פרקט שמחולק ל־11 חלקים. השדות המרכזיים כוללים ששה שדות טקסט של הפרסונה ו־16 שדות דמוגרפיים שמאפשרים לסנן את האוכלוסייה לפי גיל, אזור מיקוד או מקצוע לפני תחילת העבודה.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-USA")

הרישיון

המאגר מופץ ברישיון cc-by-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, ולאמן עליו מודלים חופשיים או סגורים. הדרישה היחידה היא מתן קרדיט ברור לאנבידיה וליוצרי המאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗