GPT
L

lmsys_chat_1m_clean

קוד פתוח

OpenLeecherרישיון לא דווח2024-07-28

גרסה מסוננת של שיחות משתמשים אמיתיים, שנוקו מכפילויות וג׳אנק וקיבלו תשובות חדשות משני מודלים לצד ציוני תגמול. היא חוסכת לכם עבודת סינון מלוכלכת על מיליון פרומפטים גולמיים.

  • 369הורדות בחודש
  • 89לייקים

מה זה

המאגר מבוסס על lmsys-chat-1m המקורי, שעבר תהליך ניקוי אגרסיבי במיוחד. היוצר מחק כפילויות מדויקות של הוראות והוריד את הנפח מחצי מיליון למיליון. בהמשך הוסרו רשומות שכללו צנזור פרטי משתמש בגלל פגיעה בהקשר, נופו כ־90 אלף פניות ספאם ודפוסי התקפה בעזרת ביטויים רגולריים, ונזרקו לפח מעל 100 אלף רשומות שאינן באנגלית בעזרת מסווג ייעודי.

שארית המאגר, כ־270 אלף רשומות, הורצה מחדש מול שני מודלים: Phi-3-mini ו־DeepSeek-V3. התשובות עברו ניקוד באמצעות מודל תגמול של Skywork, וסווגו לפי רמת צנזורה ומוסרנות, חלוקה לכ־30 קטגוריות נושאיות, זיהוי שאלות מבוססות עובדה חד-משמעית וסימון בעיות בפרומפטים כמו חוסר במידע או בקשות בלתי אפשריות.

מתאים ל

  • אימון מודלי העדפה

    השוואה ישירה בין שתי תשובות שונות לאותו פרומפט עם ניקוד תגמול מוכן.

  • סינון בקשות פגומות

    שימוש בתגיות הפגמים כדי ללמד מודל לזהות פניות חסרות או משימות בלתי אפשריות.

  • בדיקת עמידות לצנזורה

    ניתוח מקרים שבהם מודלים מסרבים לענות מול מקרים שבהם הם מספקים מענה מלא.

איפה זה נופל

ההגבלה הראשונה היא השפה. היוצר זרק במודע את כל מה שלא אנגלית כדי לפשט את הסיווג, כך שאין כאן עברית בכלל. בנוסף, היוצר עצמו מודה שחלק מהמסווגים שלו טועים, בעיקר אלה שניסו לזהות פגמים בניסוח או עובדות מוחלטות בקטגוריות כמו כתיבה יוצרת. קיימת גם צנזורה פוליטית חיצונית שהפילה שאלות רגישות במודל של דיפסיק, ויש הטיות סגנוניות ואורך ברורות לטובת מודל אחד בניקוד התגמול.

שאלות
נפוצות

מותר להשתמש במאגר הזה למוצר מסחרי?

לא מומלץ בכלל. היוצר לא דיווח על רישיון כלשהו בדף המאגר. בלי רישיון מפורש, לקחת את המידע הזה למוצר מסחרי חושף אתכם לסיכון משפטי.

האם יש בדאטהסט שיחות בעברית?

לא. היוצר אימן מסווג מיוחד שזרק מעל מאה אלף רשומות שלא נכתבו באנגלית. המאגר נקי לחלוטין משפות אחרות, כולל עברית.

מה ההבדל בינו לבין lmsys-chat-1m המקורי?

הגרסה המקורית מלאה בכפילויות, ספאם וטקסטים מצונזרים מחוקי פרטיות. כאן מחקו את הזבל, צמצמו ל־270 אלף רשומות באנגלית, ויצרו תשובות חדשות עם מודלים עדכניים וציוני איכות.

האם אפשר לסמוך על הסיווגים של הרשומות בעיניים עצומות?

לא. היוצר מציין בפירוש שיש שגיאות בסיווגים, בעיקר בזיהוי שאלות עובדתיות מוחלטות ובאיתור בקשות לקויות. אם אתם בונים על זה אימון רגיש, כדאי לדגום ולבדוק את התגיות בעצמכם.

איך טוענים

המאגר יושב בהאגינג פייס וכולל ארבעה קבצי parquet עיקריים תחת תיקיית המידע, לצד קובץ הסבר. אין צורך בבקשת גישה מיוחדת או באישור של היוצר כדי להוריד את הקבצים, והם פתוחים למשיכה מיידית בספריית המידע של פייתון.

לפני שמתחילים לרוץ על זה באימון, צריך לקחת בחשבון את המבנה של הרשומות. המידע כולל לא רק את הפרומפט המקורי, אלא גם את התשובות של שני המודלים, ציוני התגמול היחסיים ושלל תגיות הסיווג שהיוצר הצמיד להן. מומלץ לבנות מראש פילטר שמוותר על רשומות שסומנו כבעייתיות או מצונזרות.

from datasets import load_dataset

ds = load_dataset("OpenLeecher/lmsys_chat_1m_clean")

הרישיון

היוצר לא הגדיר שום רישיון במאגר. מבחינה משפטית זה משאיר אתכם בערפל מוחלט. אסור להניח שמותר להשתמש בזה למוצר מסחרי, ואי אפשר לדעת מה ההשלכות על משקולות של מודל שתאמנו על הדאטה הזה. זה מתאים בעיקר לבדיקות פנימיות ולמחקר.

הרישיון המלא ב־Hugging Face ↗