GPT
N

Nemotron-Personas-Singapore

קוד פתוח

nvidiacc-by-4.02026-01-26

  • synthetic
  • personas
  • NVIDIA
  • datadesigner

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר מכיל פרסונות סינתטיות שנבנו לפי נתוני מפקד האוכלוסין של סינגפור מ־2024. הוא מיועד למי שרוצה לייצר שיחות או תוכן שמייצגים אוכלוסייה מגוונת בלי להסתמך על נתוני אמת של אנשים חיים.

  • 774הורדות בחודש
  • 59לייקים

מה זה

המאגר כולל 148 אלף רשומות המכילות בסך הכל 888 אלף תיאורי פרסונה שונים. כל רשומה כוללת 20 עמודות טקסט המשלבות מאפיינים דמוגרפיים קשיחים לצד שדות נרטיביים מפורטים. בין השדות תמצאו שש פרסונות ייעודיות לכל דמות, כולל פרסונה מקצועית, ספורטיבית, אמנותית, קולינרית, פרסונת טיולים ופרסונה כללית, לצד רקע תרבותי, תחומי עניין ושאיפות קריירה.

הבסיס הסטטיסטי נשען על מפקד האוכלוסין הסינגפורי לשנת 2024 בשילוב מאגרי שמות פומביים של הרשויות המקומיות. נתוני התפלגות הגילאים, המין, המצב המשפחתי, ההשכלה ואזורי המגורים הוזנו למודל גרפי הסתברותי שפיתחה אנבידיה. משם, מודל השפה GPT-OSS-120B יצר את התיאורים המילוליים באנגלית תחת מערך בדיקות וסינון אוטומטי של החברה.

כל הנתונים מחולקים ל־55 אזורי תכנון בסינגפור ומתרכזים באוכלוסייה בוגרת בלבד מגיל 18 ומעלה. שמות פרטיים ושמות משפחה לא מופיעים כשדות נפרדים כדי למנוע זיהוי, אך שימשו ברקע בעת יצירת הפרופילים כדי לייצר מגוון שמות תואם מציאות.

מתאים ל

  • סימולציית שיחות מרובות דוברים

    יצירת דיאלוגים מגוונים להדרכת מודלי שיחה על בסיס רקע תרבותי, תחומי עניין שונים ופערי גילאים.

  • אימון מערכות ללא קריסה סינתטית

    גיוון דאטה סינתטי למודלים גדולים כדי למנוע הידרדרות של פלטים הנובעת מחזרתיות.

  • בדיקת התאמה לדמוגרפיה ייעודית

    הערכת תגובות של סוכני תוכנה מול טיפוסי משתמשים בעלי השכלה, תעסוקה ואזורי מגורים מוגדרים.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על הנחות עצמאות סטטיסטיות מפשטות, כמו ההנחה שמשלח יד אינו תלוי בהשכלה בהינתן גיל ומחוז. המאגר מתמקד אך ורק במבוגרים מגיל 18 ולא כולל ילדים. כמו כן, כדי להימנע מסטריאוטיפים נחתכו מהמאגר פרסונות הקשורות לתחומי בריאות, פיננסים ודת, ושמות ישירים הושמטו. זהו מאגר סינתטי מלא, ולכן יש לבחון אותו היטב לפני שימוש במוצר שדורש דיוק עובדתי אותנטי ולא רק גיוון סגנוני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן. הרישיון הוא cc-by-4.0 ואנבידיה מצהירה במפורש שהמאגר מוכן לשימוש מסחרי. עליכם רק לציין את המקור ולתת ייחוס מתאים.

כמה שוקל הדאטהסט והאם נדרש חומרה כבדה כדי לטעון אותו?

נפח האחסון הכולל הוא כחצי ג'יגה בייט והוא מחולק לשני קובצי parquet. אפשר להוריד ולעבד אותו בקלות על כל מחשב פיתוח רגיל ללא צורך בתשתית ייעודית.

האם יש במאגר טקסטים בעברית?

לא. כל 118 מיליון הטוקנים במאגר כתובים באנגלית בלבד. אם תרצו להשתמש בפרסונות עבור משתמשים דוברי עברית, תצטרכו לתרגם את השדות הנרטיביים בעצמכם.

האם מדובר בנתונים של אנשים אמיתיים מסינגפור?

לא. כל הפרופילים נוצרו באופן מלאכותי לחלוטין באמצעות מודל שפה. הדמוגרפיה, הגילאים והאזורים מתבססים על נתוני מפקד האוכלוסין מ־2024, אך הדמויות עצמן מומצאות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות שורת קוד אחת המצביעה על nvidia/Nemotron-Personas-Singapore. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין. נפח האחסון הכולל עומד על כחצי ג'יגה בייט, והנתונים שמורים בשני קובצי parquet פשוטים לקריאה. כדאי להתמקד בשדות המגדר, הגיל, אזור המגורים ורמת ההשכלה כדי לחתוך את המידע לפי קהלי יעד רצויים לפני שמושכים את תיאורי הפרסונה הארוכים.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Personas-Singapore")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי ומחקר חופשי, כולל אימון מודלים והתאמתם, ללא חובת שיתוף תחת אותו רישיון. התנאי היחיד הוא מתן קרדיט ברור לאנבידיה בהתאם להנחיות הציטוט שמצורפות למאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗