GPT
N

Nemotron-Personas-El-Salvador

קוד פתוח

nvidiacc-by-4.02026-06-03

  • synthetic
  • personas
  • NVIDIA
  • datadesigner
  • sovereign-ai

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מיליון פרופילי דמויות סינתטיים בספרדית של אל סלוודור, מבוססים על נתוני מפקד אמיתיים מ־2024. מתאים למי שבונה שיחות מותאמות תרבותית באמריקה הלטינית.

  • 700הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל 148,000 רשומות, כאשר כל שורה מחזיקה שבע פרסונות שונות המצטברות למיליון דמויות בסך הכל, לצד 18 מאפיינים דמוגרפיים. הטקסטים מקיפים כ־300 מיליון טוקנים ב־13 שדות נרטיביים שמתארים היבטים מקצועיים, משפחתיים, קולינריים ואמנותיים. הנתונים לא נאספו כטקסטים חיים מהרשת אלא נוצרו באופן סינתטי על ידי שילוב של מודל גרפי הסתברותי ומודל gpt-oss-120b דרך כלי NeMo Data Designer.

הבסיס הסטטיסטי נשען ישירות על מפקד האוכלוסין והדיור הדיגיטלי של אל סלוודור משנת 2024 ועל נתוני מרשם האוכלוסין המקומי. החלוקה הגיאוגרפית מכסה את כל 14 המחוזות ו־44 הרשויות המקומיות במדינה. הסינון מתבטא בהגבלת הגילאים לבגירים בלבד, לצד סף של לפחות עשר רשומות לשמות לפני שילובם בתהליך, כדי למנוע זיהוי של אזרחים ספציפיים.

מתאים ל

  • אימון בוטים בספרדית

    סימולציה של שיחות מגוונות בספרדית מקומית עם מגוון רקעים תרבותיים ומקצועיים.

  • מניעת קריסת מודל במידע סינתטי

    הזרמת גיוון דמוגרפי אמיתי של שמות ועיסוקים לתהליכי סינתזה מבוססי מודלי שפה.

  • הערכת הטיות במודלי שפה

    בדיקת התנהגות מודלים מול חתכים שונים של גיל, מגורים עירוניים או כפריים והשכלה.

איפה זה נופל

כל הטקסט הוא סינתטי לחלוטין ובספרדית בלבד, ללא ייצוג לעברית או לשפות אחרות. הנתונים מוגבלים לגילאי 18 עד 100 ואין בהם ילדים או בני נוער. למרות השימוש בנתוני מפקד, יוצרי המאגר מציינים כי הניחו הנחות אי-תלות סטטיסטיות לצורך הפשטה, כמו ניתוק הקשר בין מקצוע לתואר אקדמי עבור גיל ואזור נתונים. בנוסף, הושמטו שדות שמות מפורשים ופרסונות שנוגעות לתחומי בריאות ופיננסים תאגידיים, כך שהנתונים אינם מתאימים לבדיקת מערכות פיננסיות או רפואיות.

שאלות
נפוצות

האם המאגר מותר לשימוש מסחרי?

כן. הרישיון הוא CC BY 4.0 והיוצרים מציינים במפורש שהדאטהסט מיועד לשימוש מסחרי ולא מסחרי. יש להקפיד על מתן קרדיט ל־NVIDIA ול־WideLabs.

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים והטקסטים הנרטיביים נוצרו בספרדית של אל סלוודור. הוא אינו מיועד לפרויקטים בעברית אלא למי שבונה מודלים לאמריקה הלטינית.

איך הנתונים נאספו אם מדובר בטקסט סינתטי?

הטקסט יוצר באמצעות שילוב של מודל גרפי הסתברותי ומודל שפה, אך ההתפלגויות נשענות על נתוני מפקד האוכלוסין והדיור הרשמי של אל סלוודור מ־2024. שמות הדמויות והמשקלים הדמוגרפיים מבוססים על מאגר מרשם האוכלוסין הציבורי.

האם המאגר מכיל שמות אמיתיים של אנשים?

השדות שנוצרו כוללים שמות פרטיים ושמות משפחה נפוצים מהמרשם, אך שדות שם ייעודיים הוסרו מהקובץ הסופי כדי להקטין סיכון של זיהוי או שינון. כל פרופיל נרטיבי מייצג דמות בדיונית.

איך טוענים

המאגר זמין להורדה חופשית ללא צורך באישור גישה מיוחד, ומחולק לשלושה קבצי Parquet תחת תיקיית data. בטעינה שגרתית באמצעות ספריית datasets מקבלים טבלה עם 25 עמודות, שבהן מזהה ייחודי uuid, שדות נרטיב כמו persona ו־cultural_background, ורשימות מקודדות במחרוזות JSON כמו skills_and_expertise_list. הנתונים מובנים ונוחים לשליפה לפי פילוחים כמו education_level, occupation או department.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-El-Salvador")

הרישיון

המאגר מופץ תחת רישיון Creative Commons Attribution 4.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולאמן עליו מודלים באופן חופשי. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים, ללא חובת שיתוף של תוצרי המודל תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗