GPT
S

sharegpt-raw

קוד פתוח

philschmidother2023-04-04

שיחות גולמיות מתוך ShareGPT לצד סקריפטים לעיבוד וניקוי עצמאי. המאגר מתאים למי שרוצה שליטה מלאה בסינון הטקסט לפני אימון מודל שיחה.

  • 304הורדות בחודש
  • 91לייקים

מה זה

המאגר מכיל קובצי JSON גולמיים שנאספו מתוך אתר ShareGPT, שבו משתמשים שיתפו שיחות שניהלו עם ChatGPT. במקור יש כאן שני חלקים שמכילים יחד 90,665 רשומות, וקובצי הפייתון המצורפים מיועדים למזג אותם ולנקות תגיות HTML. לפי תיעוד הריצה, תהליך הניקוי הראשוני מדלג על 13,745 שיחות ומשאיר 76,920 שיחות נקיות.

לאחר הניקוי הבסיסי, הסקריפטים מסננים את השיחות לפי שפה. התיעוד מציג חילוץ של 55,413 שיחות באנגלית ו־6,240 שיחות בסינית מתוך סך השיחות הנקיות. שלב נוסף בצינור העבודה חותך שיחות ארוכות בעזרת טוקנייזר של מודל LLaMA כדי להתאים אותן לאימון, מה שמפצל את 61,653 השיחות המסוננות ל־126,032 מקטעים קצרים יותר.

מתאים ל

  • אימון מודל שיחה

    יצירת דאטהסט ייעודי לפיין טיונינג של מודלי שפה על שיחות רב שלביות באנגלית או בסינית.

  • בניית צינור ניקוי שיחות

    שימוש בסקריפטים המצורפים כבסיס לסינון תגיות HTML, חיתוך לפי שפות ופיצול שיחות לפי טוקנים.

  • מחקר על הנחיות משתמשים

    ניתוח האופן שבו אנשים מנסחים שאלות ומנהלים אינטראקציה מול מודלי שיחה ציבוריים.

איפה זה נופל

הנתונים מבוססים על מה שמשתמשים בחרו לשתף בפומבי בתחילת 2023, ולכן יש בהם הטיה מובנית לנושאים פופולריים באותה תקופה ואיכות משתנה של שאלות ותשובות. מעבר לכך, אין כאן נתונים מעובדים מראש אלא דרישה להריץ שרשרת עיבוד בעצמכם. הסקריפט הקיים לסינון שפות מוגדר לקבל רק קוד שפה בודד בכל הרצה, כך שאם אתם בונים על עברית, תצטרכו לשנות את הקוד כדי לבדוק אם יש ייצוג כזה וכמה שיחות בכלל שרדו.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון מוגדר כ־other ולכן אין היתר מסחרי מפורש. בנוסף, מדובר בפלטים של ChatGPT, ושירותים כאלה כוללים לעיתים קרובות תנאי שימוש שאוסרים אימון מודלים מסחריים מתחרים. אם אתם בונים מוצר לחברה, עדיף לא להסתמך על המאגר הזה.

האם יש בדאטהסט שיחות בעברית?

הכרטיס מציג במפורש רק סינון של 55,413 שיחות באנגלית ו־6,240 בסינית מתוך 76,920 שיחות נקיות. שאר 15,267 השיחות כוללות שפות אחרות שלא פורטו בתיעוד. כדי לדעת אם קיימת עברית וכמה ממנה יש, תצטרכו להריץ את סקריפט הסינון עם קוד השפה המתאים.

איך הנתונים האלה נאספו בפועל?

הנתונים הגיעו משירות ShareGPT, אתר שאיפשר למשתמשים ליצור קישור ציבורי לשיחות שניהלו עם מודלים. היוצר שמר את הדפים בפורמט HTML ואיגד אותם לשני קובצי JSON גולמיים. משם, המאגר מספק כלים לחלץ את הטקסט, לנקות את התגיות ולסדר את השיחה במבנה מסודר.

מה ההבדל בין המאגר הזה לגרסאות מעובדות של ShareGPT?

בניגוד למאגרים מוכנים שכבר מגיעים מחולקים ומוכנים לאימון מיידי, כאן מקבלים את קובצי המקור יחד עם כלי הניקוי. זה נותן לכם יכולת לשנות את אופן הסרת התגיות, לבחור שפות אחרות או לקבוע גודל חיתוך שונה לשיחות. החיסרון הוא שנדרשת עבודת עיבוד מקומית לפני שאפשר להתחיל לעבוד.

איך טוענים

המאגר לא מגיע כטבלה מוכנה לטעינה ישירה בספריית datasets אלא כערכת קבצים וסקריפטים. אתם מורידים את המאגר, מתקינים את התלויות מתוך requirements.txt ומריצים את merge.py לאיחוד שני חלקי ה־JSON. לאחר מכן מריצים את clean_sharegpt.py לניקוי ה־HTML, וממשיכים לסינון שפות עם optional_clean.py. אם תרצו לחתוך שיחות ארוכות, תצטרכו משקלים מקומיים של LLaMA לצורך פעולת הסקריפט.

from datasets import load_dataset

ds = load_dataset("philschmid/sharegpt-raw")

הרישיון

הרישיון מוגדר כ־other, מה שאומר שאין כאן רישיון קוד פתוח סטנדרטי ומוכר. המידע מורכב מפלט של ChatGPT ששותף על ידי גולשים, תחום שכולל מגבלות שימוש של OpenAI על אימון מודלים מתחרים. בלי הגדרה ברורה מהיוצר, אסור להניח שמותר להשתמש בזה למוצר מסחרי, וכל מי שמאמן על זה מודל לוקח סיכון משפטי.

הרישיון המלא ב־Hugging Face ↗