GPT
C

ChatQA-Training-Data

קוד פתוח

nvidiaother2024-04-29

  • RAG
  • conversational QA
  • multi-turn QA
  • QA with context
  • train

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף נתונים לאימון מודלי שיחה ומענה על שאלות מבוסס הקשר, שמיועד למי שרוצה לשחזר או לשפר יכולות RAG שיחתיות בלי לאסוף ידנית עשרות מקורות אקדמיים שונים.

  • 702הורדות בחודש
  • 176לייקים

מה זה

המאגר מאגד מגוון רחב של מקורות קיימים ומחלק את העבודה לשני שלבי אימון. בשלב הראשון נעשה שימוש בנתוני כוונון הוראות כלליים שמקורם במאגרים כמו דולי, פלאן, סלף אינסטראקט, סודה, אופן אסיסטנט ואחרים. השלב השני משלב את נתוני ההוראות עם מאגרי שאלות ותשובות ייעודיים, לצד שיחות סינתטיות שנוצרו באמצעות המודל של אופנאיי.

המבנה של שלב שני כולל יחס ערבוב מדויק בין המקורות. יש בו משימות הבנת נקרא קצרות כמו סקוואד, ניוזקיואיי ודרופ, לצד משימות חישוב והבנת טבלאות מתוך טאטקיואיי. לכל דאטהסט הוצמדה הנחיה מפורשת בתור המשתמש, שמגדירה למודל אם לענות בקצרה, להחזיר תשובה מלאה ומנומקת, או לחלץ מספר ולבצע פעולת חשבון מהטקסט.

מתאים ל

  • אימון RAG שיחתי

    כוונון מודלים לשליפת מידע ומענה מדויק על בסיס פסקאות טקסט באנגלית למטרות מחקר.

  • שחזור מודל צ'אטקיואיי

    הרצת שני שלבי האימון לפי יחסי הערבוב וקובצי היאמל המצורפים לבדיקת ביצועים.

  • אימון למענה חשבוני מטקסט

    שימוש בתת המאגר שמתמקד בטבלאות וחישובים מתוך מסמכים כדי לחלץ נתונים כמותיים.

איפה זה נופל

החלק הסינתטי בדאטהסט, שתופס שלושים אחוזים מהשלב השני, נוצר כולו באמצעות מודל ישן יחסית של אופנאיי מיוני 2023. המאגר כולו באנגלית בלבד, ואין בו ייצוג לשפות אחרות. מעבר לכך, התשובות בחלק גדול מהמקורות מוגבלות לחילוץ מקטעים קצרים, כך שאם אתם בונים מודל שצריך לייצר ניסוחים חופשיים ומורכבים בעברית, החומר הזה פשוט לא רלוונטי עבורכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. החלק של השיחות הסינתטיות, שמהווה חלק משמעותי מנתוני שלב שתיים, מוגבל במפורש לשימוש לא מסחרי בלבד. בנוסף, כל תת מאגר כפוף לרישיון המקורי שלו, כך שאי אפשר לקחת את המכלול ולהוציא ממנו מודל מסחרי.

האם יש במאגר תמיכה בעברית?

אין שום תמיכה בעברית. כל הנתונים, הטקסטים וההוראות נאספו ונוצרו באנגלית בלבד. אם המטרה היא מערכת מקומית, תצטרכו לתרגם את הנתונים או לחפש מקורות אחרים.

איך נאספו הנתונים?

המאגר מורכב משילוב של מאגרי מחקר מוכרים כמו סקוואד, אלי5 ודולי, יחד עם שיחות סינתטיות שנוצרו במיוחד לצורך הפרויקט בעזרת המודל של אופנאיי. אנשי אנבידיה לא אספו מידע גולמי מהרשת אלא איגדו ועיבדו סטים קיימים לפי יחסי ערבוב מוגדרים.

כמה רשומות יש בדאטהסט?

היקף הנתונים עומד על בין עשרת אלפים למאה אלף רשומות בסך הכל, המחולקות בין תיקיות ומקורות שונים. מדובר בגודל בינוני שמתאים בעיקר לכוונון עדין ממוקד ולא לאימון בסיס של מודל שפה מאפס.

איך טוענים

הנתונים מחולקים לתיקיות לפי מקור המידע, ברובן קובצי ג'ייסון בשם train.json, יחד עם קובצי קונפיגורציה בפורמט יאמל לשני שלבי האימון. אין צורך באישור גישה כדי להוריד את הקבצים. במקור האימון רץ על מגהטרון, כך שמי שרוצה להשתמש בזה בסביבה אחרת יצטרך לקרוא את קובצי הג'ייסון ולמפות את שדות ההוראה וההקשר למבנה שמתאים לספריית האימון שלו.

from datasets import load_dataset

ds = load_dataset("nvidia/ChatQA-Training-Data")

הרישיון

החלק הסינתטי מוגבל לשימוש לא מסחרי בלבד וכפוף לתנאי השימוש של אופנאיי, מה שפוסל את המאגר השלם משימוש במוצרים מסחריים. שאר הנתונים מבוססים על מאגרים חיצוניים, וכל אחד מהם נושא את הרישיון המקורי שלו. מודל שתאמנו על כלל המאגר יהיה כבול למגבלות האלו.

הרישיון המלא ב־Hugging Face ↗