GPT
N

Nemotron-Personas-Korea

קוד פתוח

nvidiacc-by-4.02026-04-20

  • synthetic
  • personas
  • NVIDIA
  • Korean
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מיליון רשומות סינתטיות המייצגות שבעה מיליון פרופילי אישיות בקוריאנית. המאגר נבנה על בסיס נתונים דמוגרפיים רשמיים כדי לאמן מודלים שמשקפים את האוכלוסייה המקומית.

  • 7,578הורדות בחודש
  • 555לייקים

מה זה

המאגר כולל מיליון רשומות המחזיקות 1.7 מיליארד טוקנים בקוריאנית. כל רשומה מורכבת מ־26 שדות, ביניהם מזהה ייחודי, 12 שדות הקשר גאוגרפיים ודמוגרפיים, שישה שדות של תכונות טבעיות כמו רקע תרבותי, שאיפות מקצועיות ותחביבים, ושבעה שדות המציגים טיפוסי אישיות שונים: תעסוקה, ספורט, אמנות, טיולים, קולינריה, משפחה וגרסה תמציתית.

הפרופילים נבנו באמצעות המערכת NeMo Data Designer ומודל השפה gemma-4-31B-it בשילוב מודל גרפי הסתברותי. הנתונים הבסיסיים נשענים על מקורות רשמיים בדרום קוריאה: נתוני מפקד האוכלוסין של KOSIS, שמות ולידות מבית המשפט העליון, נתוני ביטוח הבריאות הלאומי, סקר צריכת מזון של מכון הכלכלה הכפרית וידע תשתיתי של NAVER Cloud.

מתאים ל

  • הרחבת נתונים סינתטיים

    יצירת פרומפטים מגוונים לחילוץ תשובות סינתטיות ממודלי שפה בלי לחזור על אותן דמויות.

  • הפחתת הטיות בקוריאנית

    אימון מודלים תרבותיים על פילוח גילאי, אזורי והשכלתי שמדמה את נתוני האמת בדרום קוריאה.

  • הערכת עקביות מודלים

    בדיקת יכולת המודל לשמור על זהות, תחומי עניין ורקע מקצועי בתרחישי שיחה מורכבים.

איפה זה נופל

כל הפרופילים במאגר הם סינתטיים ומכסים אך ורק בוגרים מגיל 19 ומעלה. בנוסף, חסרים בו נתונים על מגדר שאינו מין ביולוגי, ומודל ה־PGM מניח אי-תלות סטטיסטית מלאה בין משתנים כמו מין, הכנסה והשכלה, כך שהשפעות גומלין אינן מיוצגות. הנתונים מוגבלים לחלוטין לקוריאנית, ולא תמצאו כאן שמות פרטיים נפרדים, תכונות אישיות מופשטות או פרופילים עסקיים בתחומי הבריאות והפיננסים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי חופשי לחלוטין. התנאי היחיד הוא מתן קרדיט ברור למפרסמים, ללא חובת שיתוף של הנגזרות באותו רישיון.

האם יש בדאטהסט טקסטים בעברית או באנגלית?

לא, כל המאגר בנוי בקוריאנית בלבד ומכוון ספציפית לאוכלוסייה ולתרבות של דרום קוריאה. אם המערכת שלכם אינה מיועדת לעיבוד שפה או שווקים בקוריאה, הנתונים לא יהיו רלוונטיים עבורכם.

כיצד נאספו הנתונים?

הנתונים אינם סריקה של אנשים אמיתיים ברשת אלא מידע שנוצר באופן סינתטי לחלוטין. NVIDIA השתמשה במודל הסתברותי שנשען על סטטיסטיקות ממשלתיות רשמיות וסקרים לאומיים, והפיקה את הטקסט בעזרת המודל gemma-4-31B-it.

במה המאגר שונה מדאטהסטים גנריים של פרסונות?

רוב מאגרי הפרופילים מציגים הטיה כבדה לקבוצות גיל צעירות ומקצועות הייטק טיפוסיים. המאגר הזה נבנה מראש כדי לייצג אוכלוסייה מבוגרת, תושבי פריפריה חקלאית ופילוח משקי בית אמיתי לפי התפלגויות רשמיות.

איך טוענים

הנתונים מפוצלים לתשעה קובצי Parquet תחת תיקיית data, לצד קובצי תמונה ותיעוד, בסך הכל 22 קבצים במאגר. אין צורך באישור גישה או בחתימה על הסכם סגור כדי להוריד את הקבצים. בעת הטעינה כדאי לסנן מראש עמודות לפי הצורך, מפני שמלבד שדות הדמוגרפיה הבסיסיים כמו מחוז, גיל ומצב משפחתי, שבעת שדות הטקסט של הפרופילים מכילים יחד כמיליארד טוקנים ומעמיסים על הזיכרון.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-Korea")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. המשמעות היא שאתם רשאים להשתמש בנתונים לכל מטרה, כולל פיתוח מודלים מסחריים והפצת תוצרי אימון, כל עוד אתם מעניקים קרדיט מתאים ליוצרים ב־NVIDIA.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗