GPT
N

nli-zh-all

קוד פתוח

shibing624cc-by-4.02023-06-14

מאגר ענק של זוגות משפטים בסינית מפושטת למשימות דמיון טקסטואלי והסקה לוגית. הוא מרכז מיליוני דוגמאות ממקורות שונים במבנה אחיד שחוסך עבודת איסוף ידנית.

  • 2,132הורדות בחודש
  • 46לייקים

מה זה

הרשומות מכילות זוגות טקסט עם תיוג בינארי של דמיון או סתירה. הטקסטים נאספו מתוך שילוב רחב של מאגרים קיימים בסינית, ביניהם שאילתות חיפוש, ערכי ויקיפדיה, שאלות ותשובות מאתר ז'יהו, ביקורות מוצרים מאמזון, שיחות רפואיות, מאמרים אקדמיים ותרגומים של מאגרי הסקה מוכרים באנגלית.

במקום שמירה על הפורמט המקורי של כל מקור, הנתונים הומרו למבנה אחיד של משימת סיווג. הסינון כלל הסרה בסיסית של שורות ריקות וטקסטים באורך קטן מתו אחד, מה שהשאיר מעל שמונה מיליון רשומות שמחולקות לקבצים לפי המקור המקורי שלהן.

מתאים ל

  • אימון מודלי שיקוע בסינית

    כיול מודלים לחישוב דמיון סמנטי בין משפטים בסינית מפושטת.

  • מערכות חיפוש וצימוד שאלות

    זיהוי שאלות כפולות במערכות תמיכה או שירות לקוחות.

  • מבחני ביצועים להסקה לוגית

    בדיקת יכולת המודל להבין קשרים לוגיים בין שני היגדים.

איפה זה נופל

יש פער משמעותי באיכות בין חלקי המאגר. חלק מהדוגמאות נוצרו באמצעות מודלים כמו GPT-3.5 או תורגמו מאנגלית, ולכן הן כוללות ניסוחים סינתטיים ותרגום מכונה. בנוסף, חילוץ המידע ממנועי חיפוש ומפורומים מכניס רעש טקסטואלי. אין כאן מילה אחת בעברית או תמיכה בריבוי שפות, והנתונים מייצגים סינית מפושטת בלבד שנאספה עד מחצית שנת 2023.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא כדאי להסתמך על זה. אף על פי שמצוין רישיון פתוח בראש העמוד, הטבלה הפנימית מראה שרוב המאגרים המרכיבים אותו אינם מאושרים למסחר, והיוצר ציין שהשימוש מיועד למחקר בלבד.

האם יש במאגר נתונים בעברית?

אין שום תוכן בעברית. כל הנתונים כתובים בסינית מפושטת בלבד, ונועדו למשימות עיבוד שפה טבעית ייעודיות לשפה הזו.

כמה מקום המאגר תופס בדיסק?

הקבצים שוקלים בסך הכל ארבעה נקודה שבעה ג'יגה בייט. הנתונים פרוסים על פני קובצי JSONL לפי מקורות המידע השונים.

איך טוענים

הנתונים מחולקים לשישה עשר קובצי טקסט נפרדים במבנה שורות JSON, בנפח כולל של ארבעה נקודה שבעה ג'יגה בייט. אין צורך בבקשת גישה מיוחדת כדי להוריד אותם. בכל שורה יש שלושה שדות בלבד: שני שדות טקסט של המשפטים להשוואה, ושדה תיוג מספרי שמציין אם מדובר בגרירה לוגית ודמיון או בניגוד.

from datasets import load_dataset

ds = load_dataset("shibing624/nli-zh-all")

הרישיון

המאגר מוגדר ברמת המטא דאטה תחת רישיון פתוח שדורש ייחוס, אך הטקסט של הכרטיס מציין במפורש שהוא מיועד למחקר בלבד. מעבר לזה, רבות מהדוגמאות נלקחו ממאגרים חיצוניים שאוסרים שימוש מסחרי באופן פרטני. אם המטרה היא לאמן מודל למוצר מסחרי, שימוש במאגר הזה חושף אתכם לסיכון משפטי ברור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗