GPT
L

LongCite-45k

קוד פתוח

zai-orgapache-2.02024-09-02

  • long context
  • citation generation
  • SFT

מאגר שמביא 44,600 דוגמאות של שאלות ותשובות על טקסטים ארוכים במיוחד, כולל מראי מקום מדויקים ברמת המשפט. מי שבונה מודל שחייב לגבות טענות במקור ייעזר בזה מאוד.

  • 874הורדות בחודש
  • 78לייקים

מה זה

המאגר כולל 44,600 רשומות המיועדות לשאלות ותשובות על פני הקשרים ארוכים, שמגיעים עד 128,000 מילים. כל רשומה בנויה מארבעה מרכיבים ברורים: הנחיה למודל, הקשר ארוך שמחולק למשפטים בודדים, שאלת משתמש, ותשובה שכוללת הפניות ישירות למשפטי המקור שתומכים בה.

התוכן עצמו מגיע בשתי שפות בלבד, אנגלית וסינית. לפי הכרטיס, המטרה היא ללמד מודלי שפה להפיק תשובה מנומקת יחד עם ציטוט מדויק בפלט אחד, במקום להסתמך על חיפוש נפרד או ניחושים של המודל לגבי המיקום של המידע בטקסט.

המפתחים לא מפרטים בכרטיס את מקורות הטקסט הגולמי, איך הוא סונן או מה היחס המדויק בין אנגלית לסינית. המאגר נשמר בקובץ long.jsonl שמחזיק את כל הנתונים כמקשה אחת, בלי חלוקה מוגדרת מראש לסט אימון או בדיקה.

מתאים ל

  • אימון מודלים להפקת ציטוטים

    לימוד מודלי שפה לענות על שאלות מורכבות תוך הפניה למשפטי מקור מדויקים בטקסט.

  • מענה על מסמכים ארוכים

    התמודדות עם טקסטים של עשרות אלפי מילים הדורשים ביסוס עובדתי מהיר.

  • הערכת אמינות תשובות

    בדיקת היכולת של מודל קיים להימנע מהזיות על ידי השוואת הציטוט לתוכן המקורי.

איפה זה נופל

הבעיה המרכזית כאן היא שאין עברית בכלל, הנתונים הם באנגלית ובסינית בלבד. בנוסף, כרטיס הדאטהסט לא מפרט מאיפה הגיעו הטקסטים המקוריים, האם יש בהם עובדות מיושנות או הטיות תרבותיות, ואיך בוצע הסינון בפועל. אם אתם מכניסים את זה למוצר, תצטרכו לבדוק בעצמכם האם הציטוטים תואמים בדיוק את המשפטים המקוריים ולא הומצאו בתהליך ההכנה של הסט.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא, המאגר מכיל אך ורק נתונים באנגלית ובסינית. מי שרוצה לעבוד בעברית יצטרך לתרגם את הנתונים בעצמו או לאסוף סט מקומי, כי כרגע אין בו שום ייצוג לשפה.

מאיפה הגיעו הטקסטים ואיך הם נאספו?

דף המאגר הנוכחי לא מפרט את מקורות המידע או את שיטות הדגימה והסינון. המידע הזה עשוי להופיע במאמר המדעי שצורף בקישור, אבל הקובץ עצמו לא כולל תיעוד על מקור הטקסטים.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר פעילות מסחרית מלאה. עליכם רק להקפיד לצרף את הודעת הרישיון והייחוס המקורי לקוד או למוצר שלכם.

איזה מבנה נתונים מקבלים בכל שורה?

כל דוגמה בפורמט jsonl מכילה הוראה למודל, את גוף הטקסט כשהוא מפורק למשפטים, את שאלת המשתמש, ואת התשובה שכוללת מראי מקום למשפטים הרלוונטיים. המבנה הזה נשמר באופן אחיד לכל אורך 44,600 הרשומות.

איך טוענים

טוענים את המאגר ישירות מתוך long.jsonl בעזרת ספריית datasets או קריאת jsonl פשוטה בפייתון. אין כאן שום צורך לבקש אישור גישה מוקדם או להמתין למפתח API, המאגר פתוח לחלוטין להורדה. לפני שמתחילים לרוץ עליו, שימו לב שההקשרים מגיעים לאורכים של עד 128,000 מילים, כך שצריך חומרה עם זיכרון משמעותי כדי להתמודד עם הטוקניזציה והאימון בלי קריסות.

from datasets import load_dataset

ds = load_dataset("zai-org/LongCite-45k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים והפצה מחודשת שלהם, בלי חובה לשתף את השינויים תחת אותו הרישיון. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והייחוס המקורי של המפתחים. מודלים שתאמנו על הדאטהסט יכולים לשמש לפעילות מסחרית לפי תנאי הרישיון הזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗