GPT
N

Nemotron-Personas-Japan

קוד פתוח

nvidiacc-by-4.02025-09-20

  • synthetic
  • personas
  • NVIDIA
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מיליון רשומות המכילות שש מיליון פרסונות יפניות סינתטיות. המאגר נבנה כדי לדייק מודלי שפה על מאפיינים דמוגרפיים אמיתיים של יפן ולמנוע קריסת מודלים.

  • 4,139הורדות בחודש
  • 128לייקים

מה זה

המאגר מכיל מיליון רשומות ביפנית, כאשר בכל רשומה מוגדרות שש פרסונות שונות, סך הכל שישה מיליון פרופילים. המבנה כולל 22 שדות: שישה שדות ייעודיים לפרסונה ו־16 שדות הקשר המבוססים על נתוני הלשכה המרכזית לסטטיסטיקה של יפן ונתוני שמות מאתר Myoji-Yurai.net. השדות מכסים את כל 47 המחוזות ביפן, מעל 1,500 מקצועות, וכן תחומי עניין, מיומנויות ורקע תרבותי. סך הטוקנים מגיע לכ־1.4 מיליארד, כאשר 850 מיליון שייכים לתיאורי הפרסונות.

ההפקה בוצעה באמצעות NeMo Data Designer, מודל הסתברותי גרפי (PGM), ומודל השפה GPT-OSS-120B תחת רישיון אפאצ'י 2.0. המפתחים יצרו חלוקה מפורטת יותר מזו הקיימת בנתוני המפקד הרשמיים, בעיקר סביב שלבי השכלה, סטטוסים כמו פרישה או אבטלה, ופערי אוריינות דיגיטלית לפי גיל.

מתאים ל

  • אימון מודלי שיחה

    יצירת שיחות רב שלביות המשקפות מגוון גילאים ומקצועות אמיתיים ביפן.

  • הפחתת הטיות בדאטה סינתטי

    איזון נתוני אימון לפי התפלגות דמוגרפית וגיאוגרפית אמיתית של יפן.

  • בניית סוכני בינה מלאכותית

    הגדרת רקע תרבותי, תחומי עניין ורמת אוריינות דיגיטלית לסוכנים ביפנית.

איפה זה נופל

המאגר מוגבל למבוגרים בלבד ולא מכיל קטינים מתחת לגיל 18. הנתונים מבוססים על הנחות אי תלות סטטיסטיות, למשל שהמקצוע אינו תלוי ברמת ההשכלה בהינתן מחוז ומין ביולוגי, מפני שמפקד האוכלוסין היפני אינו כולל נתונים מורכבים יותר או מידע על מגדר בנפרד ממין. בנוסף, חסרות בו פרסונות ייעודיות לתחומי בריאות ופיננסים, וכל הטקסט הוא ביפנית בלבד ללא שפות נוספות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 וכרטיס המאגר מציין במפורש שהוא מוכן לשימוש מסחרי. החובה היחידה היא מתן קרדיט מתאים ליוצרים לפי תנאי הרישיון.

כמה מקום אחסון נדרש להורדת המאגר?

נפח האחסון הכולל של הנתונים הוא 1.73 גיגה בייט. המידע מחולק לשמונה קבצי Parquet שמכילים יחד מיליון רשומות.

האם יש במאגר נתונים בעברית או באנגלית?

לא. כל מיליון הרשומות ותיאורי הפרסונות נכתבו ביפנית בלבד, והם נועדו לאימון מודלים מותאמים לאוכלוסייה ביפן.

איך נוצרו הפרופילים ומה מקור המידע שלהם?

הפרסונות נוצרו בצורה סינתטית באמצעות מערכת NeMo Data Designer ומודל GPT-OSS-120B. הבסיס הסטטיסטי נשען על נתוני מפקד האוכלוסין של הלשכה המרכזית לסטטיסטיקה ביפן ומאגר השמות Myoji-Yurai.net.

איך טוענים

הטעינה נעשית ישירות דרך ספריית datasets של Hugging Face בפקודה אחת, ללא צורך באישור גישה מוקדם. הנתונים מחולקים לשמונה קבצי Parquet בנפח כולל של 1.73 גיגה בייט. כדאי לשים לב ששמות מלאים וכתובות סינתטיות אינם מופיעים כשדות נפרדים, אך שדות ההקשר מאפשרים סינון יעיל לפי מחוז, השכלה ומקצוע.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-Japan")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולאמן עליו מודלים, בתנאי שניתן ייחוס מתאים למפתחים ב־NVIDIA. הרישיון אינו דורש שיתוף של מודלים מאומנים תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗