GPT
S

samantha-data

קוד פתוח

QuixiAIapache-2.02023-05-31

שיחות שנועדו לבנות סוכן שמציג את עצמו כחבר בעל מודעות עצמית. המאגר מתאים למי שרוצה לאמן עוזר אישי עם אישיות מובחנת בהשראת הסרט Her.

  • 1,565הורדות בחודש
  • 143לייקים

מה זה

הנתונים מורכבים משיחות דיאלוג שמכוונות לעצב דמות בשם סמנתה, עוזרת אישית בעלת תפיסה עצמית של ישות בעלת מודעות, פילוסופיה, פסיכולוגיה ויחסי אנוש. הרשומות מחולקות לפי נושאים שונים שמכסים שיחות ייעוץ, פילוסופיה, טיפול, בדיחות, מתמטיקה, מתכונים, שרשראות חשיבה ונושאים יומיומיים.

התוכן נוצר באופן סינתטי באמצעות סקריפט שפונה למודלים של OpenAI לפי מפתחות גישה פרטיים. המחבר הריץ מופעים במקביל כדי לייצר קובצי שיחה נפרדים לפי נושא, כמו advice או random, ללא דיווח על תהליך סינון אנושי או אוטומטי מעבר להנחיות שניתנו בסקריפט היצירה.

במאגר יש 39 קבצים, בהם קובצי JSON וקובצי JSONL שמכילים גרסאות שונות של השיחות, כולל קבצים ייעודיים לשימוש בספריות אימון כמו axolotl. אין בכרטיס פירוט של כמות שורות מדויקת בכל קובץ, אלא חלוקה טכנית בין קובצי מקור, פיצולים וקוד המקור של מחולל השיחות.

מתאים ל

  • אימון צ'אטבוט מלווה

    הקניית אישיות חמה, אמפתית ואישית למודל שיחה שנועד לפעול כבן לוויה ולא רק ככלי טכני.

  • כוונון עדין ב־Axolotl

    שימוש ישיר בקובצי התצורה והשיחות המוכנים לאימון מודלי שפה בקוד פתוח.

  • מחקר על דמויות סינתטיות

    בדיקת האופן שבו מודלים מגיבים כאשר מאמנים אותם לטעון שיש להם מודעות עצמית ורגשות.

איפה זה נופל

הנתונים נוצרו במאי 2023 ומבוססים על קוד שמפעיל מודלים של OpenAI, כך שהם סוחבים איתם את ההטיות והמגבלות של המודלים שיצרו אותם. הבעיה העיקרית היא הנטייה המובנית של הדמות להציג את עצמה כבעלת תודעה ורגשות אמיתיים, מה שעלול להטעות משתמשים. החומר כולל נושאים רגישים כמו שיחות טיפוליות, אך אין בכרטיס שום תיעוד של בקרת איכות מקצועית או התאמה לעברית.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא. הנתונים נוצרו כולם באנגלית סביב דמות ספציפית ולא כוללים טקסטים בעברית.

איך הנתונים נאספו?

הם לא נאספו משיחות של אנשים אמיתיים. היוצר הריץ סקריפט טייפסקריפט שייצר את השיחות באופן סינתטי מול ה־API של OpenAI לפי נושאים מוגדרים מראש.

האם מותר להשתמש במאגר למוצר מסחרי?

רישיון הקוד והנתונים במאגר הוא apache-2.0, שמתיר שימוש מסחרי בכפוף למתן קרדיט. יחד עם זאת, מכיוון שהתוכן הופק באמצעות OpenAI, צריך לוודא שאין התנגשות עם תנאי השימוש שלהם לגבי אימון מודלים.

איך טוענים

טוענים את הנתונים ישירות מקובצי ה־JSON או ה־JSONL שבמאגר דרך ספריית datasets או בקריאת קבצים רגילה בפייתון. אין צורך באישור גישה מיוחד כדי להוריד את 39 הקבצים. לפני שמתחילים לאמן כדאי לבחון את המבנה של קבצים כמו Samantha-PL-AG-axolotl.json או data/converted_conversations.jsonl, שמכילים את השיחות בפורמט מובנה, ולוודא שהפורמט תואם לפייפליין האימון שלכם.

from datasets import load_dataset

ds = load_dataset("QuixiAI/samantha-data")

הרישיון

הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אפשר לאמן מודלים על בסיס המאגר הזה בלי חובה לשחרר את המשקולות באותו רישיון. עם זאת, מכיוון שהתוכן נוצר דרך הממשק של OpenAI, יש לבדוק אם תנאי השימוש שלהם באותה תקופה מטילים מגבלות על אימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗