GPT
A

all-nli

קוד פתוח

sentence-transformersרישיון לא דווח2024-04-25

  • sentence-transformers

איחוד מוכן של צמדי משפטים מתוך שני מאגרי היסק מובילים, המיועד לאימון מודלי שיבוץ של דמיון סמנטי. החבילה מגיעה כבר מנוקה מכפילויות ובמבנים שונים לפי שיטת האימון שלכם.

  • 3,937הורדות בחודש
  • 51לייקים

מה זה

המאגר מחבר יחד שני מקורות קלאסיים בתחום הסקת שפה טבעית, SNLI ו־MultiNLI. כל הנתונים עברו הסרת כפילויות, והם מסודרים בארבע תצורות שונות כדי לחסוך עבודת עיבוד מוקדם. החלוקה הראשונה שומרת על הפורמט המקורי עם טענה, היפותזה ותווית סיווג של גרירה, ניטרליות או סתירה. החלוקה השנייה ממירה את התוויות האלו לציונים רציפים של אפס, חצי ואחת כדי להתאים לחישובי דמיון.

שני החלקים הנוספים בנויים ישירות לאימון ניגודי של שיבוצים. יש תת מאגר של זוגות חיוביים בלבד שמכיל עוגן ומשפט נגרר, ללא היפוך תפקידים ביניהם. החלק האחרון מייצר שלשות מלאות של עוגן, דוגמה חיובית ודוגמה שלילית שנשלפה מתוך המשפטים הסותרים של אותה טענה.

מתאים ל

  • אימון משבצי טקסט

    כוונון עדין של מודלי שפה למשימות אחזור מידע ודמיון סמנטי באנגלית באמצעות שלשות מוכנות.

  • אימון סיווג היסק

    בניית מודלים לזיהוי יחסי גרירה וסתירה בין משפטים על גבי דאטה נקי מכפילויות.

  • הערכת ביצועי שיבוץ

    בדיקת איכות של מודלי דמיון בעזרת מדדי דירוג רציפים על סטי המבחן הייעודיים.

איפה זה נופל

המאגר כולו מבוסס על אנגלית בלבד. אם המטרה שלכם היא עבודה בעברית, הנתונים האלה לא יעזרו לכם בלי תרגום או התאמה נוספת. מעבר לזה, המקורות הם טקסטים שנאספו עבור משימות הסקה ישנות, והכרטיס לא מפרט סינון של הטיות תוכן, רעילות או פערי ייצוג שקיימים בדאטה המקורי. חובה לבדוק את התאמת הנתונים לפני שמשלבים אותם במערכת שמשרתת משתמשים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

היוצרים לא הגדירו רישיון בכרטיס המאגר, ולכן אין היתר שימוש ברור. מי שמתכנן שימוש מסחרי צריך לגשת למאגרי המקור SNLI ו־MultiNLI ולבדוק את תנאי השימוש שלהם ישירות.

האם יש תמיכה בעברית?

לא. כל המשפטים והדוגמאות במאגר כתובים באנגלית בלבד. כדי לעבוד בעברית תצטרכו להשתמש במאגרים אחרים או לתרגם את הנתונים בעצמכם.

מה ההבדל בין התצורות השונות במאגר?

הנתונים מגיעים בארבעה מבנים: סיווג קטגורי, ציונים מספריים, זוגות של עוגן ומשפט חיובי, ושלשות מלאות לאימון ניגודי. זה חוסך לכם לכתוב קוד שמחלץ דוגמאות שליליות מתוך נתוני ההיסק.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה sentence-transformers/all-nli, בלי צורך באישור גישה מיוחד. המאגר מכיל 14 קבצים בפורמט parquet ומחולק מראש לסטים של אימון, בדיקה ואימות. לפני הטעינה צריך לבחור את תת המאגר המתאים למבנה האימון הרצוי: pair-class, pair-score, pair או triplet.

from datasets import load_dataset

ds = load_dataset("sentence-transformers/all-nli")

הרישיון

בדף המאגר לא דווח רישיון כלל. מבחינה משפטית מדובר בסיכון, כי אי אפשר לדעת בוודאות אם מותר להשתמש בתוצרים לצרכים מסחריים או מה המגבלות על הפצת מודל שאומן עליהם. אם אתם בונים מוצר מסחרי, תצטרכו לבדוק את תנאי הרישיון המקוריים של SNLI ושל MultiNLI בעצמכם.

הרישיון המלא ב־Hugging Face ↗