GPT
S

ShareGPT_Vicuna_unfiltered

קוד פתוח

anon8231489123apache-2.02023-04-02

שיחות אמיתיות שנוקו מסירובים ומהטפות מוסר של מודלים. המאגר מתאים למי שרוצה לאמן מודל שיחה ישיר בלי משפטים מתחמקים.

  • 418,175הורדות בחודש
  • 917לייקים

מה זה

המאגר מכיל שיחות משתמשים שנלקחו מתוך ShareGPT, לאחר סינון אגרסיבי שהוריד את הכמות מכמאה אלף שיחות לכחמישים ושלוש אלף בלבד. השיחות חולקו למקטעים באורך 2048 תווים, במטרה להתאים ישירות לאימון מודלים לפי שיטת פאסט צ'אט עבור ויקונה.

הסינון התמקד בהסרת שיחות שאינן באנגלית, תווי יוניקוד חריגים ותווים חוזרים. מעבר לכך, המפרסם סילק באופן שיטתי שיחות שכללו ביטויי מוסר, סירובים, הצהרות של מודל שפה ונושאים שנויים במחלוקת. המאגר כולל 14 קבצים, ביניהם קובצי מקור, קבצים מנוקים מפורמט HTML, מחברת אימון, ושתי גרסאות עיקריות של השיחות הסופיות בפורמט ג'ייסון.

גרסה אחת מנקה בנוסף גם כל מופע של הביטוי אני מצטער אבל, בעוד שהגרסה השנייה משאירה אותו. לפי המפרסם, הסרת הביטוי עלולה למחוק מידע מועיל, אך השארתו עשויה ללמד את המודל לסרב לפעולות כמו גלישה ברשת.

מתאים ל

  • אימון מודלי שיחה ישירים

    אימון מודל צ'אט שמגיב ישר ולעניין בלי להקדים התנצלויות והסברים על היותו מודל בינה מלאכותית.

  • מחקר על דאטה ללא פילטרים

    בדיקת ההשפעה של הסרת שיחות מוסר על התנהגות מודל ויקונה ונטייתו לסרב לפקודות.

  • שילוב סוכנים עם כלים חיצוניים

    אימון סוכנים שמיועדים להפעלת כלים כמו גלישה ברשת, מבלי שיתקעו בסירובים מובנים.

איפה זה נופל

הסינון כאן פרימיטיבי למדי ומבוסס על רשימת מילים שחורות. כל שיחה שהכילה מילים כמו חוק, אתיקה, גזענות, אפליה או אפילו קפיטליזם נזרקה לפח, מה שמייצר הטיה ברורה ומרוקן את הדאטה משיחות על נושאים מורכבים. בנוסף, הנתונים הם מאפריל 2023 וכוללים אנגלית בלבד. אין כאן עברית כלל, שכן טקסטים שאינם באנגלית ותווים מיוחדים סוננו החוצה במכוון.

שאלות
נפוצות

האם יש במאגר שיחות בעברית?

לא. המפרסם סינן במפורש כל שיחה שאינה באנגלית, כולל הסרת תווי יוניקוד חריגים. הדאטהסט כולו מוגדר לשפה האנגלית בלבד.

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון המדווח על ידי מעלה המאגר הוא אפאצ'י 2.0, שמאפשר שימוש מסחרי מלא. יחד עם זאת, מדובר בשיחות שמקורן באתר ShareGPT והופקו במקור על ידי מודלים מסחריים, דבר שכדאי לקחת בחשבון.

מה ההבדל בין שתי הגרסאות המרכזיות במאגר?

ההבדל מתמצה בביטוי אני מצטער אבל. גרסה אחת מסירה את כל השיחות שמכילות את הביטוי כדי למנוע סירובים לחלוטין, ואילו הגרסה השנייה שומרת עליהן כדי לא לאבד מקרים שבהם המודל רק ביקש הבהרה מהמשתמש.

איך הדאטה נאסף ונערך?

הבסיס הוא כמאה אלף שיחות משתמשים מ־ShareGPT. המפרסם סינן אותן באמצעות רשימת ביטויים אסורים, פיצל את הטקסט למקטעים של 2048 תווים לפי מתודולוגיית פאסט צ'אט, וצמצם את המאגר לכ־53 אלף שיחות.

איך טוענים

טוענים את המאגר ישירות מקובצי הג'ייסון שבמאגר, בלי צורך בבקשת גישה מיוחדת. הקובץ המרכזי הוא ShareGPT_V3_unfiltered_cleaned_split.json או גרסת ה־no_imsorry שלו, תלוי במידת הסינון הרצויה. המאגר כולל גם מחברת פייתון בשם Vicuna_unfiltered_train.ipynb המדגימה את תהליך העבודה, והמבנה תואם להנחיות העיבוד של פאסט צ'אט.

from datasets import load_dataset

ds = load_dataset("anon8231489123/ShareGPT_Vicuna_unfiltered")

הרישיון

המאגר מדווח תחת רישיון אפאצ'י 2.0, שמתיר שימוש מסחרי, שינוי והפצה בלי דרישה לפתוח את הקוד או את המודל המאומן באותו רישיון. נדרש רק לתת ייחוס ולצרף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗