GPT
N

Nemotron-Personas-Brazil

קוד פתוח

nvidiacc-by-4.02026-01-25

  • synthetic
  • personas
  • NVIDIA
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שישה מיליון פרופילים סינתטיים בפורטוגזית שנבנו לפי נתוני הלשכה המרכזית לסטטיסטיקה של ברזיל. המאגר מתאים למי שרוצה לאמן מודל שיחה עם הקשר מקומי אמיתי ולא שטוח.

  • 894הורדות בחודש
  • 101לייקים

מה זה

המאגר כולל מיליון רשומות, כאשר בכל רשומה מוגדרות שש פרסונות שונות. המבנה מורכב מעשרים עמודות, שכוללות שישה שדות טקסט חופשי של פרסונה וארבעה עשר שדות הקשר סטטיסטיים, כמו מיקום גיאוגרפי, גיל, מצב משפחתי ותחום תעסוקה לפי סיווג רשמי. הטקסטים מציגים רקע תרבותי, תחומי מומחיות, יעדים ותחביבים בתחומים כמו ספורט, אמנות וקולינריה.

התוכן נוצר כולו באופן סינתטי על ידי שילוב של מודל הסתברותי גרפי ומודל השפה GPT-OSS-120B במסגרת מערכת NeMo Data Designer של אנבידיה. הנתונים מבוססים על התפלגויות דמוגרפיות מתוך נתוני מפקד האוכלוסין של IBGE ומאגר השמות הרשמי של המדינה, ללא דגימת בני אדם אמיתיים ישירות.

מתאים ל

  • אימון מודלי שיחה

    יצירת שיחות סינתטיות רב שלביות בפורטוגזית שנשענות על דמויות בעלות רקע מקצועי ותרבותי אמין.

  • הפחתת הטיות דמוגרפיות

    איזון נתוני אימון קיימים כדי לייצג אוכלוסיות שונות מכל רחבי ברזיל לפי נתוני מפקד רשמיים.

  • מבחני התאמה לשווקים

    הערכת תפקוד של עוזרי בינה מלאכותית מול פרופילים מגוונים בעלי רמות השכלה ותחומי עניין מוגדרים.

איפה זה נופל

הנתונים כוללים אך ורק מבוגרים, ואין בהם ילדים או בני נוער. תהליך הדגימה מניח הנחות אי תלות סטטיסטיות שלא תמיד תואמות את המציאות, למשל שהעיסוק המקצועי אינו תלוי ברמת ההשכלה כאשר המיקום והמין קבועים. בנוסף, נתוני המפקד הרשמיים אינם כוללים מידע מפורט על זהות מגדרית מעבר למין ביולוגי, ולכן הגיוון בנושא זה מוגבל. המאגר נבנה כולו בפורטוגזית ומותאם לברזיל בלבד, כך שאין בו תועלת ישירה עבור עברית או פרויקטים מקומיים בישראל, והוא גם מחריג תחומי פעילות כמו בריאות ופיננסים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון CC-BY-4.0 מתיר שימוש מסחרי מלא ואימון מודלים לכל מטרה. הדרישה היחידה היא מתן קרדיט מתאים ליוצרי המאגר.

האם הדאטהסט כולל שמות מלאים וכתובות אמיתיות של אזרחים?

לא, כל הפרסונות נוצרו בצורה סינתטית לחלוטין על בסיס מודלים הסתברותיים. שדות של שמות פרטיים נפרדים, שמות משפחה וכתובות מגורים מדויקות הושמטו במכוון כדי להגן על פרטיות.

האם יש במאגר תוכן בעברית?

לא, המאגר מיועד כולו לשפה הפורטוגזית ומשקף את המציאות החברתית בברזיל. הוא מתאים למי שבונה מודלים שמיועדים לפעול באזור זה.

איך המאגר מונע קריסת מודל בהשוואה לדאטהסטים סינתטיים אחרים?

במקום להסתמך רק על פלטים של מודלי שפה, המערכת דוגמת קודם התפלגויות סטטיסטיות אמיתיות של מפקד האוכלוסין. זה מבטיח שהפרופילים מייצגים את פיזור הגילאים, המקצועות והאזורים האמיתי ולא הטיות של מודל בודד.

איך טוענים

המאגר מחולק לאחד עשר קובצי Parquet ששמורים תחת תיקיית הנתונים הראשית, ללא צורך בהרשאת גישה מיוחדת או בחתימה על הסכם סגור. טוענים אותו ישירות דרך ספריית datasets באמצעות המזהה הרשמי. היקף המאגר עומד על כמיליארד וארבע מאות מיליון תוקנים בסך הכל. ששת שדות הפרסונה מכילים את עיקר הטקסט הרציף, וארבעה עשר שדות ההקשר משמשים לסינון חיתוכים דמוגרפיים מוגדרים מראש לפי מדינות בברזיל, עיסוקים, השכלה או מגדר.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-Brazil")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי מלא, מחקר, שינוי והפצה, ומאפשר לאמן עליו מודלים חופשיים או קנייניים. התנאי היחיד הוא מתן קרדיט ברור לאנבידיה ולחברת WideLabs, ללא חובה לשתף את הנגזרות או את המודלים המאומנים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗