GPT
D

databricks-dolly-15k-curated-multilingual

קוד פתוח

argillacc-by-sa-3.02023-04-13

  • machine-translated
  • instruction-following

גרסה מתוקנת ומתורגמת של מאגר ההוראות דולי, שכוללת ניקוי שגיאות ידני ותרגום מכונה. המאגר מתאים למי שרוצה לאמן מודל פקודות רב-לשוני על בסיס נקי יותר מהמקור.

  • 468הורדות בחודש
  • 54לייקים

מה זה

המאגר מכיל עשרות אלפי רשומות של הוראות, הקשרים ותשובות, שנבנו על בסיס דאטהסט ההוראות המקורי שיצרה Databricks בשנת 2023. הצוות של Argilla זיהה בעיות מהותיות במקור, בעיקר מתייגים שלא הבינו את תפקיד שדה ההקשר והשתמשו בו לא נכון במשימות סיכום וחילוץ מידע. כדי לפתור את זה, הם איתרו רשומות בעייתיות בקוד ותיקנו ידנית כ־400 מהן, מה שקיצר משמעותית את אורך התשובות וההקשרים.

בנוסף לתיקונים האנושיים, הצוות מחק באמצעות ביטוי רגולרי הערות שוליים מוויקיפדיה מיותר מ־8,100 שורות. החלוקה במאגר מתבצעת לפי שפות, כאשר לצד האנגלית המתוקנת נוספו תרגומים לגרמנית, צרפתית וספרדית שבוצעו באמצעות ה־API של DeepL.

מתאים ל

  • אימון מודל פקודות

    כוונון עדין של מודלי שפה לקבלת הוראות באנגלית, ספרדית, גרמנית או צרפתית.

  • ייצור נתונים סינתטיים

    יצירת פרומפטים מגוונים לטובת הרחבת מאגרי מידע קיימים במשימות שונות.

  • טיוב נתונים ידני

    הקמת סביבת עבודה ב־Argilla לבדיקה ותיקון של תרגומי מכונה לפני אימון.

איפה זה נופל

השפות הנוספות, ספרדית, צרפתית וגרמנית, תורגמו במלואן בתרגום מכונה של DeepL באפריל 2023. הצוות עצמו מציין שאיכות התרגום לא מושלמת וממליץ לתקן אותה לפני שימוש רציני. בנוסף, התיקון הידני באנגלית טיפל רק בכ־400 רשומות מתוך 15 אלף, והיוצרים מודים שסביר להניח שנשארו בעיות רבות במבנה השאלות. אין כאן עברית כלל, וכל מי שבונה מודל לשפה המקומית יצטרך לתרגם ולתקן את הטקסטים בעצמו.

שאלות
נפוצות

האם המאגר כולל עברית?

המאגר אינו כולל עברית כלל. הוא מכיל אנגלית מתוקנת ותרגומים לצרפתית, גרמנית וספרדית בלבד. משתמשים ישראלים שרוצים לאמן מודלים בעברית יצטרכו לבצע תרגום וסינון עצמאיים של הנתונים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך כולל סעיף שיתוף זהה תחת cc-by-sa-3.0. משמעות הדבר היא שכל נגזרת של המאגר חייבת להשתחרר תחת אותו הרישיון. חברות צריכות לבדוק עם ייעוץ משפטי כיצד הסעיף הזה משפיע על משקולות המודל הסופי.

מה ההבדל בין המאגר הזה ל־Dolly 15k המקורי?

הגרסה הזו עברה תיקון חלקי של שגיאות תיוג נפוצות בשדה ההקשר, כולל עריכה ידנית של כ־400 דוגמאות. בנוסף, הוסרו ממנה מראי מקום מוויקיפדיה באלפי שורות כדי לשפר את איכות הטקסט. הגרסה כוללת גם תרגום אוטומטי לשלוש שפות אירופיות שלא קיימות במקור.

איך נוצרו התרגומים לשפות הנוספות?

הטקסטים באנגלית תורגמו באמצעות ה־API של שירות DeepL באמצע אפריל 2023. לא נעשתה ולידציה אנושית מלאה על התרגומים האלה, ולכן הם עלולים לכלול שגיאות תרגום וסגנון. היוצרים ממליצים לסנן ולתקן את הנתונים לפני שמכניסים אותם לאימון מודל.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפונקציה load_dataset. הקבצים יושבים בפורמט Parquet בחלוקה לפי שפות, ללא צורך באישור גישה או ברישום מיוחד. אפשר להוריד את כל החלוקות יחד או לציין שפה בודדת דרך הפרמטר split, למשל לספרדית, צרפתית, גרמנית או אנגלית. השדות המרכזיים כוללים הוראה, הקשר ותשובה, כאשר שדה ההקשר עבר סינון ומחיקת הפניות מיותרות.

from datasets import load_dataset

ds = load_dataset("argilla/databricks-dolly-15k-curated-multilingual")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-3.0 ומאפשר שימוש מסחרי ומחקרי כאחד. הרישיון דורש מתן קרדיט מלא ליוצרים, כולל ציון חברת Databricks כבעלת המאגר המקורי. חובת השיתוף באותו רישיון חלה על שינויים ונגזרות של המאגר עצמו, מה שמחייב בדיקה משפטית מדוקדקת לגבי מעמדו של מודל שמאומן עליו.

הרישיון המלא ב־Hugging Face ↗