GPT
S

ShareLM

קוד פתוח

shachardonרישיון לא דווח2024-02-14

שיחות אמיתיות בין אנשים למודלי שפה, מרוכזות במקום אחד במבנה אחיד. המאגר מאחד מקורות פתוחים קיימים יחד עם דאטה שנאסף מתוסף כרום ייעודי.

  • 2,746הורדות בחודש
  • 37לייקים

מה זה

המאגר מאגד בין מיליון לעשרה מיליון רשומות של שיחות מול מודלים, בפורמט אחיד. רק כ־3,500 שיחות הגיעו ישירות מהתוסף של הפרויקט, שבו משתמשים תרמו היסטוריית צ'אט דרך הדפדפן. שאר המידע מורכב מדאטהסטים ציבוריים מוכרים כמו WildChat, hh-rlhf של Anthropic, PIPPA, bAbI ומאגרי משחקי תפקידים. היוצרים לא אספו מחדש את המקורות האלה, הם פשוט המירו אותם למבנה משותף.

כל שורה כוללת מזהה שיחה, רשימת הודעות של המשתמש והמודל, שם המודל, מזהה משתמש, חותמת זמן ושם המקור המקורי. בחלק מהרשומות קיימים גם שדות מטא-דאטה על השיחה עצמה, כמו דירוג או כותרת, ופרטים דמוגרפיים על המשתמש כמו גיל ומיקום, בהתאם למה שהמקור סיפק. הנתונים מהתוסף עברו סינון להסרת פרטים מזהים.

מתאים ל

  • אימון מודלי שיחה

    שימוש ברצפי השיחות המגוונים כדי ללמד מודל בסיס לנהל שיחה מרובת שלבים באנגלית.

  • מחקר על פרומפטים של משתמשים

    ניתוח הדרכים שבהן אנשים מנסחים שאלות ובקשות מול מודלים שונים בעולם האמיתי.

  • אימון להתאמת סגנון ומשחק

    סינון קובצי משחקי התפקידים כדי לאמן מודלים על סגנונות כתיבה ודמויות מוגדרות מראש.

איפה זה נופל

השפה המדווחת היא אנגלית בלבד, ואין כאן התאמה או סינון לעברית. בנוסף, מדובר בערבוב של מקורות שונים מאוד באופיים, החל ממשימות bAbI ישנות ועד שיחות פרועות מ־WildChat, מה שיוצר חוסר אחידות באיכות התשובות ובסגנון. הסינון לפרטים מזהים נעשה רק על הדאטה שהגיע מהתוסף, ולכן במקורות האחרים אתם תלויים לחלוטין ברמת הניקוי של מי שיצר אותם במקור. אי אפשר לקחת את זה ישר לאימון בלי לעשות בדיקת איכות וטוקניזציה עצמאית.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

אין לכך תשובה חד-משמעית כי המאגר לא כולל רישיון כולל. החלק שנאסף על ידי ShareLM מוגדר ללא הגבלות מצידם בכפוף לתנאי המודל המקורי, אבל רוב הקבצים נלקחו מדאטהסטים אחרים. כדי לעבוד מסחרית תצטרכו לבדוק את הרישיון של כל מקור בנפרד.

האם יש במאגר שיחות בעברית?

המאגר מוגדר רשמית תחת השפה האנגלית בלבד. ייתכן שבתוך מיליוני השיחות ממקורות כמו WildChat הסתננו משפטים בודדים בעברית ממשתמשים, אבל אין כאן דאטה ייעודי או מתאים לפיתוח מודלים בעברית.

מה ההבדל בין המאגר הזה לבין מקורות כמו Anthropic hh-rlhf?

ההבדל הוא בעיקר בריכוז ובאחידות. ShareLM לא המציא את רוב הנתונים, אלא לקח מאגרים מוכרים כמו זה של Anthropic ואחרים, והמיר את כולם לאותו מבנה שדות בדיוק כדי לחסוך עבודת ניקוי ראשונית.

איך בדיוק נאסף המידע?

חלק קטן של כ־3,500 שיחות נאסף ישירות ממשתמשים שהתקינו תוסף כרום ייעודי והסכימו לשתף את הצ'אטים שלהם. כל שאר הנתונים, שמהווים את הרוב המוחלט, פשוט הורדו ממאגרים פתוחים קיימים ברשת.

איך טוענים

הנתונים מחולקים ל־109 קבצים בפורמט parquet, לפי מקורות שונים כמו babi_formatted או gpt_role_play. אפשר למשוך אותם ישירות בלי לבקש אישור גישה מראש. אם רוצים לשלב גם את LMSYS-Chat-1M שהיוצרים מזכירים, תצטרכו להירשם אליו בנפרד כי מדובר במאגר סגור. השדות העיקריים לעבודה הם conversation שמכיל את רצף ההודעות, ו־source שעוזר לסנן מקורות ספציפיים שמתאימים למשימה שלכם.

from datasets import load_dataset

ds = load_dataset("shachardon/ShareLM")

הרישיון

למאגר עצמו לא דווח רישיון אחיד, וזה מכשול רציני למי שבונה מוצר. היוצרים הצהירו שהם לא מגבילים את השימוש בדאטה שנאסף מהתוסף שלהם, אבל כל שאר הקבצים שייכים למקורות חיצוניים עם תנאים משלהם. אי אפשר להניח שמותר להשתמש במאגר באופן מסחרי, וצריך לבדוק את הרישיון המקורי של כל קובץ ומודל לפני שמאמנים עליהם.

הרישיון המלא ב־Hugging Face ↗