GPT
B

Bactrian-X

קוד פתוח

MBZUAIcc-by-nc-4.02023-04-22

  • instruction-finetuning
  • multilingual

מאגר ענק של 3.4 מיליון זוגות הוראה ומענה ב־52 שפות שונות, כולל עברית. הוא נבנה עבור מי שרוצה לאמן מודל שיחה רב לשוני בלי להפיק דאטה סינתטי מאפס.

  • 2,264הורדות בחודש
  • 125לייקים

מה זה

המאגר מכיל בדיוק 67,017 רשומות לכל אחת מ־52 השפות הנתמכות, בסך הכל כ־3.4 מיליון דוגמאות. הבסיס נלקח משני מקורות מוכרים באנגלית: alpaca שמכיל 52 אלף הוראות ו־dolly שמכיל 15 אלף הוראות. היוצרים תרגמו את ההוראות וההקשרים לאנגלית ולעוד 51 שפות דרך Google Translate API באפריל 2023, ואז שלחו את ההוראות המתורגמות ישירות למודל gpt-3.5-turbo כדי שייצר את התשובות בכל שפה בנפרד.

המבנה של כל רשומה כולל ארבעה שדות קבועים: ההוראה עצמה, שדה קלט שמופיע בכ־40% מהמקרים ומספק הקשר למשימה, שדה הפלט שנוצר על ידי המודל, ומזהה ייחודי. המזהה הזה זהה בכל השפות ומאפשר להשוות ישירות בין אותה מטלה באנגלית לתרגום שלה בשפות האחרות. אין כאן חלוקה מובנית לסט אימון, בדיקה או ולידציה, אלא סט אימון יחיד לכל שפה.

מתאים ל

  • אימון LoRA רב לשוני

    כוונון עדין של מודלי בסיס דוגמת LLaMA להבנת הוראות במגוון שפות במקביל.

  • מחקר על פערי תרגום

    בדיקת ההשפעה של תרגום מכונה לעומת דאטה מקורי על איכות יצירת הטקסט.

  • הערכת עמידות מודלים

    מדידת ביצועים של מודלים קיימים על משימות זהות שתורגמו לעשרות שפות.

איפה זה נופל

הטקסטים לא נכתבו על ידי בני אדם בשפת המקור שלהם אלא עברו תרגום מכונה של גוגל, מה שגורר שגיאות תחביר וניסוחים מלאכותיים. מעבר לזה, המשימות המקוריות משקפות תרבות והקשרים אמריקאיים שלא תמיד הגיוניים בשפות אחרות. התשובות עצמן הופקו על ידי gpt-3.5-turbo ומכילות את ההזיות והסירובים הטיפוסיים שלו מאותה תקופה. מי שבונה מודל בעברית יקבל טקסט מתורגם ומיוצר ולא עברית טבעית, וחייב לסנן תשובות שמכילות סירובי מערכת של OpenAI.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי בחברה?

לא, הרישיון המוגדר הוא cc-by-nc-4.0 שמונע במפורש כל שימוש מסחרי. בנוסף, התשובות הופקו ממודל gpt-3.5-turbo של OpenAI, מה שמחיל מגבלות שימוש נוספות על פיתוח מודלים מתחרים.

האם הדאטהסט כולל תמיכה בעברית ובאיזה היקף?

כן, ישנו קובץ ייעודי לשפה העברית המכיל בדיוק 67,017 רשומות. עם זאת, יש לזכור שההוראות תורגמו מאנגלית בעזרת תרגום מכונה והתשובות נוצרו בעברית על ידי מודל שפה, ולא נכתבו בידי דוברי עברית.

איך נוצרו הנתונים שבתוך המאגר?

היוצרים אספו 67 אלף הוראות ממאגרי alpaca ו־dolly באנגלית ותרגמו אותן ל־51 שפות באמצעות Google Translate API. לאחר מכן, הם הזינו את ההוראות המתורגמות ל־gpt-3.5-turbo באפריל 2023 כדי לייצר את התשובות בכל שפה.

במה הוא שונה ממאגרי Alpaca ו־Dolly המקוריים?

המאגרים המקוריים הכילו טקסט באנגלית בלבד שנאסף או נוצר באופן ממוקד. הפרויקט הזה הרחיב את שניהם ל־52 שפות שונות במבנה אחיד שמאפשר לאמן מודלים רב לשוניים על אותן המשימות בדיוק.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות מזהה המאגר. המאגר פתוח לציבור ואינו דורש אישור גישה מראש. הקבצים שמורים בפורמט json דחוס ב־gzip לפי שפות, למשל קובץ נפרד לעברית בשם he.json.gz או לערבית בשם ar.json.gz. בעבודה עם מודל אימון, השדות הרלוונטיים הם instruction, input ו־output, כאשר שדה ה־id משמש בעיקר למעקב ולסינון מקבילי.

from datasets import load_dataset

ds = load_dataset("MBZUAI/Bactrian-X")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0 שמיועד למחקר ולשימוש אישי בלבד, ואוסר במפורש כל שימוש מסחרי. יש לתת ייחוס הולם ליוצרים מ־MBZUAI בעת פרסום עבודה שמבוססת עליו. מעבר למגבלות הרישיון הישיר, הנתונים הופקו באמצעות OpenAI, שאוסרת בתנאי השימוש שלה אימון מודלים שמתחרים בה, כך שמודל שאומן על המאגר לא יוכל לשמש בסיס למוצר מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗