GPT
D

databricks-dolly-15k-curated-en

קוד פתוח

argillaרישיון לא דווח2023-05-30

גרסה ערוכה של דולי המיועדת לאימון הוראות באנגלית. במקום לזרוק נתונים גולמיים למודל, עברו כאן על הטקסטים ותיקנו שגיאות והתאמות לקטגוריה.

  • 24,562הורדות בחודש
  • 45לייקים

מה זה

המאגר מכיל רשומות המחולקות לפי קטגוריית משימה, הוראה, הקשר ותשובה. הרעיון המרכזי בפרויקט היה לקחת את הדאטה המקורי של דולי ולתקן בו ידנית את ההוראות, הקלט והתשובות כדי לוודא שהתוכן מבוסס על עובדות אמיתיות ומתאים לסוג המשימה שנבחרה.

המבנה של כל שורה כולל את הנתונים המקוריים לצד שדות העריכה החדשים. המתנדבים או הבודקים עברו רשומה אחרי רשומה, העתיקו את מה שהיה תקין, ושינו ניסוחים של שאלות או תשובות שלא היו ברורות, תמציתיות או מדויקות. במידה וההקשר לא היה נחוץ למשימה, הונחו להשאיר אותו ריק, ורשומות בעייתיות במיוחד נזרקו החוצה.

מתאים ל

  • אימון מודלים באנגלית

    כיוונון מודלי שפה להבנת הוראות ומענה תמציתי על בסיס טקסטים שעברו סינון עריכתי.

  • הערכת איכות תיקונים

    השוואה בין שדות המקור לשדות המתוקנים כדי לבחון איפה מודלים והוראות אנושיות נוטים לטעות.

  • בניית משימות מבוססות הקשר

    אימון על משימות שליפת מידע שבהן ההקשר נבדק ידנית כדי לוודא שהוא רלוונטי לתשובה.

איפה זה נופל

החומר כולו באנגלית בלבד ואין פה מילה אחת בעברית. אם אתם בונים מודל מקומי, תצטרכו לתרגם הכל או לחפש מקור אחר. מעבר לזה, הכרטיס לא מפרט אילו הטיות נבדקו בפועל או מי האנשים שביצעו את הטיוב והעריכה. המאגר פורסם במאי 2023, כך שהעובדות וההקשרים משקפים את המידע שהיה נכון לאותה נקודת זמן, וצריך לבדוק ידנית את איכות התיקונים לפני שדוחפים אותם לאימון של מודל פרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא מומלץ כרגע, כי לא דווח שום רישיון בעמוד הדאטהסט. בלי הגדרה ברורה של זכויות היוצרים, אתם מסתכנים בחשיפה משפטית אם תאמנו עליו מוצר רווחי. עדיף להמתין לעדכון רשמי של היוצרים או לפנות אליהם ישירות.

האם הדאטהסט מתאים לעבודה בעברית?

המאגר מוגדר לשפה האנגלית בלבד וכל הרשומות שבו נכתבו באנגלית. אין בו תמיכה בשפה העברית, לא ברמת ההוראות ולא ברמת ההקשרים. מי שרוצה להשתמש בו למשימות בארץ יצטרך לבצע תרגום מכונה מלא של כל השדות.

איך המאגר הזה נאסף ונערך?

הבסיס הוא הדאטהסט דולי המקורי, שחולק למשימות עם הוראות, הקשרים ותשובות. צוות הפרויקט עבר על הרשומות וכתב גרסאות מתוקנות בשדות ייעודיים כדי להבטיח שהמידע מדויק והתשובות תמציתיות. רשומות שלא התאימו לקטגוריה או שהיו פגומות נפסלו וסומנו להסרה.

במה הוא שונה מדולי המקורי?

בדולי המקורי נכנסו לא מעט שגיאות ניסוח, חוסר דיוק עובדתי ותשובות שלא התאימו במדויק לקטגוריית המשימה. הגרסה הזו מוסיפה שלוש עמודות ערוכות שמתקנות את ההוראה, ההקשר והתשובה. למעשה קיבלתם את אותו הבסיס, רק אחרי בדיקה ידנית שמנקה ניסוחים עקומים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets הרגילה של פייתון בפקודת load_dataset עם המזהה של המאגר, או באמצעות ספריית argilla כמשוב נתונים. אין צורך בבקשת גישה מיוחדת, הכל פתוח להורדה ישירה. הקובץ המרכזי מגיע בפורמט parquet יחיד לפיצול האימון. השדות שמעניינים אתכם בפועל הם new-instruction, new-context ו־new-response, שמכילים את הגרסאות המתוקנות, ולא שדות ה־original שהושארו בעיקר לצורכי השוואה ובקרה.

from datasets import load_dataset

ds = load_dataset("argilla/databricks-dolly-15k-curated-en")

הרישיון

הרישיון של המאגר הזה לא דווח בכרטיס. עבור מפתח או חוקר זה אומר שאין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת בוודאות מה מותר לעשות עם מודל שאומן על הנתונים האלה. כל עוד היוצרים לא הגדירו רישיון מסודר, שימוש במוצר מסחרי כרוך בסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗