GPT
C

chinese_chatgpt_corpus

קוד פתוח

sunzeyeahunknown2023-03-21

מאגר שיחות בסינית לאימון מודלים ודירוג תשובות. הוא מרכז מיליוני שאלות ותשובות ממקורות רשת מגוונים עבור מי שבונה מודל שיחה ייעודי לשפה זו.

  • 290הורדות בחודש
  • 88לייקים

מה זה

המאגר מכיל מעל 5.4 מיליון רשומות המיועדות לשלבי אימון מונחה ולמידה מחיזוקים. כל רשומה כוללת שדה הנחיה, רשימת תשובות עם ציון מספרי לכל תשובה, ושדה קידומת שמגדיר את תחילת המענה. המבנה הזה נשמר באופן אחיד לכל אורך הנתונים.

המקורות מגיעים ממאגרים ציבוריים שונים בסינית, כולל אנציקלופדיות, אתרי שאלות ותשובות, שירה סינית קלאסית, טקסטים עתיקים ותגובות מחדשות ברשת החברתית וויבו. החלוקה הפנימית מפרידה בין קובץ אימון ראשי שכולל 5,477,982 דוגמאות לבין קובץ פיתוח ובדיקה מצומצם שמכיל 10,000 דוגמאות בלבד. כרטיס המאגר מפנה לקוד עיבוד בגיטהאב אך אינו מפרט תהליכי סינון ידניים.

מתאים ל

  • אימון מונחה למודלי שיחה

    התאמת מודלי שפה למענה על שאלות בסינית תוך שימוש במבנה הנחיה ותשובה.

  • בניית מודל תגמול

    שימוש בציונים המשויכים לתשובות כדי לאמן מודל שמעריך איכות פלט.

  • מחקר על שפה סינית

    בדיקת ביצועים על טקסטים המשלבים סינית קלאסית, שירה ותגובות רשת מודרניות.

איפה זה נופל

המאגר מוגבל לשפה הסינית בלבד ואין בו שום תוכן בעברית או באנגלית. הכרטיס כמעט ריק ממידע ביקורתי, חסרים בו פרטים על סינון תוכן רגיש או פרטי, אין תיעוד להטיות חברתיות, ולא ברור מי דירג את התשובות ואיך חולקו הציונים. בנוסף, המקורות כוללים טקסטים עתיקים לצד תגובות רשת, מה שיוצר פערי סגנון ואיכות שמחייבים בדיקה וסינון עצמאי לפני שימוש במודל ייצורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ להסתמך עליו למוצר מסחרי. הרישיון מוגדר כלא ידוע ואין שום מסמך שמסדיר את זכויות היוצרים של הטקסטים שנאספו. שימוש כזה עלול לחשוף את הפרויקט לתביעות מצד בעלי התוכן המקוריים.

כמה שטח אחסון צריך כדי לעבוד איתו?

הקבצים שוקלים יחד כ־5.05 גיגה-בייט בהורדה. מתוכם קובץ האימון תופס כ־5.04 גיגה-בייט וקובץ הבדיקה פחות מעשרה מגה-בייט. תצטרכו לפחות עשרה גיגה-בייט פנויים כדי לטעון ולעבד את המידע בנוחות.

האם המאגר רלוונטי למי שמפתח מודל בעברית?

המאגר אינו מכיל נתונים בעברית כלל. כל הטקסטים הם בסינית מודרנית וקלאסית. הוא יכול לעזור למפתח מקומי רק אם המטרה היא אימון מודל רב לשוני ספציפי או בדיקת שיטות אימון.

איך נאספו ודורגו התשובות בפועל?

החומר לוקט ממאגרים פתוחים שונים בגיטהאב הכוללים אנציקלופדיות, שירה, טקסטים היסטוריים ותגובות מוויבו. כרטיס המאגר לא מספק מידע על תהליך התיוג, כך שלא ידוע אם הציונים נקבעו על ידי בני אדם או חולצו אוטומטית ממערכות הצבעה ברשת.

איך טוענים

הנתונים מגיעים בשני קובצי JSONL פשוטים, train ו־dev, שתופסים יחד כ־5.05 גיגה-בייט על הדיסק. המאגר פתוח להורדה ישירה ללא צורך בהרשאה מוקדמת או באישור של היוצר. אפשר לטעון אותו בעזרת ספריית datasets או לקרוא ישירות שורה אחרי שורה. השדות המרכזיים שדורשים התייחסות בקוד הם prompt, המערך answers שמחזיק בכל איבר את הטקסט והציון score, והשדה prefix שמשמש להפרדה בין השאלה לתשובה בזמן האימון.

from datasets import load_dataset

ds = load_dataset("sunzeyeah/chinese_chatgpt_corpus")

הרישיון

הרישיון מוגדר כלא ידוע. היוצר לא ציין תנאי שימוש, ולכן אין היתר מפורש לשימוש מסחרי, להפצה מחדש או לשילוב במוצרים חיצוניים. אימון מודל על הנתונים האלה עבור שימוש שאינו מחקרי פנימי חושף אתכם לסיכון משפטי, שכן זכויות היוצרים של מקורות המידע המקוריים אינן ברורות.

הרישיון המלא ב־Hugging Face ↗