GPT
N

nli_zh

קוד פתוח

shibing624cc-by-4.02022-03-02

מאגר לאימון והערכה של מודלים להתאמת משפטים ודמיון סמנטי בסינית פשוטה. הוא מאחד חמישה מקורות מוכרים בתחום, כולל ATEC ו־LCQMC, בפורמט בינארי פשוט של זוגות טקסט ותוויות.

  • 2,053הורדות בחודש
  • 48לייקים

מה זה

המאגר מאגד חמישה מקורות שונים של זיהוי דמיון בין משפטים: ATEC, BQ, LCQMC, PAWSX ו־STS-B. כל רשומה כוללת שני משפטים בסינית פשוטה (sentence1 ו־sentence2) ותווית בינארית (label) שמציינת 1 עבור דמיון או 0 עבור חוסר דמיון. הדוגמאות מציגות משפטים יומיומיים או שאלות פיננסיות, כמו השוואה בין סלבריטאים או בירור על ניהול השקעות.

הנתונים נאספו ישירות מהפרויקטים המקוריים שפורסמו עבור כל אחד מחמשת המקורות, ללא שינוי מהותי מעבר לסידור השמות שביצע Jianlin Su והעלאתם לספריית הדאטהסטים על ידי shibing624. אין בכרטיס פירוט לגבי סינון נוסף שבוצע על הטקסטים בעת האיחוד.

החלוקה הפנימית מוגדרת לפי כל אחד מחמשת המקורות בנפרד, כשכל מקור מחולק לקובצי train, valid ו־test. המקור הגדול ביותר במאגר הוא LCQMC שמכיל 238,766 דוגמאות אימון, ואחריו BQ עם 100,000 דוגמאות אימון, בעוד STS-B הוא הקטן ביותר ומכיל 5,231 דוגמאות אימון בלבד.

מתאים ל

  • סיווג דמיון סמנטי בסינית

    אימון מודל לקביעה האם שני משפטים בסינית פשוטה שקולים במשמעותם.

  • הערכת ביצועי מודלי שפה

    בדיקת ביצועים של מודלי שיבוץ (embeddings) על חלוקות הבדיקה של STS-B או LCQMC.

  • זיהוי שאלות כפולות

    אימון מערכות לניתוב שאילתות על בסיס נתוני BQ ו־ATEC מתחומי שירות ושאלות נפוצות.

איפה זה נופל

הטקסט כולו כתוב בסינית פשוטה בלבד, ואין כאן שום תמיכה בשפות אחרות או בעברית. מעבר לכך, הכרטיס אינו מפרט מידע על הטיות חברתיות, שיטות הסינון, או הסרת פרטים אישיים ומזהים מהטקסטים המקוריים. המאגר פורסם במרץ 2022 ומסתמך על מקורות קודמים כמו BQ מ־2018, לכן הנתונים משקפים שפה ושימושים של אותן שנים. לפני שמשלבים מודל שאומן עליו, צריך לבדוק ידנית את איכות ההתאמות והרלוונטיות של התוכן לתחום היעד שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ. למרות שהרישיון בעמוד מציין cc-by-4.0, הטקסט בגוף הכרטיס קובע שהמאגר מיועד למחקר אקדמי בלבד ושזכויות היוצרים שייכות למחברי המקור. הסתירה הזו חושפת אתכם לסיכון משפטי במוצר מסחרי.

כמה מקום המאגר דורש בדיסק?

הקבצים להורדה שוקלים בסך הכל 16 מגה-בייט. לאחר פריסה על הדיסק המאגר תופס כ־42 מגה-בייט, כך שהוא יורד ורץ תוך שניות בודדות ללא דרישות חומרה כבדות.

האם הדאטהסט כולל נתונים בעברית?

לא, אין בו עברית כלל. כל הנתונים הם בסינית פשוטה בלבד (Simplified Chinese), ומיועדים אך ורק למשימות עיבוד שפה בסינית.

מאיפה הגיעו הנתונים שנמצאים בפנים?

המאגר אינו מכיל דאטה מקורי חדש אלא איחוד של חמישה מאגרי התאמת משפטים קיימים בסינית: ATEC, BQ, LCQMC, PAWSX ו־STS-B. היוצר אסף את הקבצים שהוסדרו על ידי Jianlin Su והעלה אותם במבנה אחיד.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה, אין צורך בבקשת אישור גישה מוקדמת. כל הקבצים שוקלים כ־16 מגה-בייט להורדה ותופסים סך הכל כ־42 מגה-בייט על הדיסק, כך שמדובר במשקל נמוך מאוד. המבנה כולל סקריפט טעינה (nli_zh.py) וקובץ הסבר. השדות היחידים לעבודה הם שני משפטי הטקסט sentence1 ו־sentence2, ועמודת label של ערך 0 או 1.

from datasets import load_dataset

ds = load_dataset("shibing624/nli_zh")

הרישיון

המטא-דאטה מדווח על רישיון cc-by-4.0 שמתיר שימוש מסחרי ועריכה עם מתן קרדיט מתאים. עם זאת, גוף הכרטיס סותר זאת במפורש ומציין שהשימוש מיועד למחקר אקדמי בלבד, ושזכויות היוצרים שייכות ליוצרי המקורות (למשל BQ שמותר למחקר אקדמי). הסתירה הזו אומרת שאי אפשר להסתמך על שימוש מסחרי במודל שמאומן על הדאטהסט הזה, ומומלץ להגביל אותו למחקר בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗