GPT
N

Nemotron-Personas-Vietnam

קוד פתוח

nvidiacc-by-4.02026-06-04

  • synthetic
  • personas
  • NVIDIA
  • Vietnamese
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מאגר נתונים סינתטי מווייטנאם שמכיל 100,000 רשומות עם 600,000 פרופילי משתמשים מלאים. הוא מיועד למי שרוצה לאמן מודלים על אוכלוסייה וייטנאמית מגוונת ומעוגנת סטטיסטית.

  • 1,208הורדות בחודש
  • 61לייקים

מה זה

המאגר כולל 100,000 רשומות בפורמט Parquet, כאשר כל רשומה מחזיקה שישה פרופילים שונים: מקצועי, ספורט, אמנות, טיולים, קולינריה ופרופיל כללי קצר. לצד הטקסטים הנרטיביים מופיעים 15 שדות הקשר ודמוגרפיה, ביניהם גיל, מין, מצב משפחתי, 20 קטגוריות תעסוקה, רמת השכלה ושיוך לאזור מגורים עירוני או כפרי.

הפרופילים נוצרו בצורה סינתטית לחלוטין באמצעות מערכת NeMo Data Designer ומודל השפה SaoLa4-Small, תוך שימוש במודל גרפי הסתברותי. הבסיס הסטטיסטי נשען על נתוני מפקד האוכלוסין והדיור של וייטנאם מ־2024, סקר רמת החיים VHLSS מ־2024, וחלוקת המחוזות המעודכנת לפי החלטת הממשלה מ־2025. חברת FPT סיפקה את התיקוף התרבותי והאימות המקומי עבור ששת המחוזות והערים שנכללו.

כל הטקסטים כתובים בווייטנאמית סטנדרטית בלבד. המאגר מכיל חלוקה אחת בלבד של נתוני אימון, ומקיף בסך הכל כ־118 מיליון טוקנים, שמתוכם 52 מיליון טוקנים מרכיבים את תיאורי הפרופילים עצמם.

מתאים ל

  • אימון סוכני שיחה מקומיים

    יצירת פרופילי משתמש ואוכלוסייה מגוונים עבור מודלים וצ'אטבוטים שפונים לשוק הווייטנאמי.

  • הפחתת הטיות בדאטה סינתטי

    שימוש בפילוח דמוגרפי שנשען על מפקד אוכלוסין רשמי כדי לאזן ייצוג גילאי ומגדרי באימון.

  • בדיקת תגובות מודל לפילוחים

    הערכת תגובות של מודלי שפה עבור טיפוסי אישיות מוגדרים מתחומי הקולינריה, האמנות והספורט.

איפה זה נופל

הנתונים כולם סינתטיים ומוגבלים לשפה הווייטנאמית בלבד, ללא שום ייצוג לעברית או לאנגלית. המאגר כולל בגירים מגיל 18 עד 90 בלבד, ומתמקד בשישה אזורים גיאוגרפיים ספציפיים ולא בכל וייטנאם. המפתחים מודים בהנחת אי-תלות סטטיסטית בין משתנים כמו גיל, מגדר והשכלה בעת קביעת משלחי היד, אילוץ שנבע ממגבלות המודל ההסתברותי וממידע ציבורי מוגבל. בנוסף, הושמטו פרופילים עסקיים בתחומי רפואה ופיננסים, ושמות מלאים ספציפיים לא נכללו בטקסט הנרטיבי כדי למנוע דמיון לאנשים אמיתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי מלא ואימון מודלים למכירה. החובה היחידה שחלה עליכם היא מתן ייחוס מתאים לחברת Nvidia ולשותפיה מפרויקט FPT.

האם המאגר כולל טקסטים בעברית או באנגלית?

לא, כל שדות הנרטיב והפרופילים נכתבו בווייטנאמית סטנדרטית בלבד. המאגר לא מתאים לאימון מודלים ייעודיים לעברית, אלא אם משתמשים במבנה הדמוגרפי בלבד כבסיס תרגום ותרבות.

האם הפרופילים מתארים אנשים אמיתיים מווייטנאם?

לא, כל 600,000 הפרופילים נוצרו בצורה מלאכותית על ידי מערכות בינה מלאכותית ומודלים גרפיים. למרות שההתפלגויות הסטטיסטיות מבוססות על מפקד האוכלוסין של 2024, כל קשר לאדם אמיתי הוא מקרי בהחלט.

מה הופך את המאגר הזה לשונה מדאטהסטים אחרים של פרסונות?

רוב מאגרי הפרסונות נשענים על פרומפטים כלליים ומייצרים אוכלוסייה אחידה ומוטה. המאגר הזה נבנה על נתוני למ״ס רשמיים מווייטנאם ומכיל פילוח מוגדר היטב לפי גיל, אזור מגורים, השכלה ומקצוע.

איך טוענים

טוענים את המאגר ישירות מספרית datasets באמצעות שם המאגר nvidia/Nemotron-Personas-Vietnam. הגישה חופשית לגמרי ואינה דורשת אישור מוקדם או מפתח גישה מיוחד. הנתונים מרוכזים בקובץ Parquet בודד תחת חלוקת train, כך שאין צורך לפצל או לאחד קבצים ידנית. בעבודה עם הנתונים כדאי לשים לב לשדות הפרופיל הנרטיביים שמגיעים כמחרוזות טקסט מלאות, לצד שדות רשימה כמו תחומי עניין ומיומנויות שנשמרו כמחרוזות ומצריכים פירוק לפני הזנה למודל.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-Vietnam")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0 שמתיר שימוש חופשי לחלוטין, כולל פיתוח מסחרי והתאמה אישית. התנאי היחיד הוא מתן קרדיט ברור ליוצרים המקוריים, חברת Nvidia ושותפיה. הרישיון אינו דורש שיתוף תחת אותו רישיון, ולכן אפשר לאמן עליו מודלים מסחריים קנייניים בלי לחשוף את המשקולות או את הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗