GPT
R

ru_turbo_alpaca

קוד פתוח

IlyaGusevcc-by-4.02023-03-21

  • instruction-finetuning
  • instruction generation
  • alpaca

זהו אוסף הוראות ותשובות ברוסית שנוצר באמצעות מודל gpt-3.5-turbo. הוא מתאים למי שרוצה לאמן מודלי שפה לעקוב אחרי פקודות ברוסית על בסיס שיטת אלפקה.

  • 1,191הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל 29,822 דוגמאות של שאלות ותשובות, שנבנו על פי מתודולוגיית self-instruct והקוד של Stanford Alpaca. המידע אינו טקסט אנושי מקורי שנאסף מרשתות או ספרים, אלא פלטים שנוצרו ישירות על ידי מודל שפה של OpenAI ברוסית כדי לחקות אינטראקציות של הנחיה ומענה.

איכות הנתונים נבדקה בשני מסלולים נפרדים שמופיעים בתיעוד. מומחה שעבר על מדגם של 400 פריטים מצא שרק 83% מההוראות היו נכונות, ורק ב־63% מהמקרים גם ההוראה וגם התשובה היו מדויקות. בדיקת המונים רחבה יותר על 3,500 דוגמאות הציגה נתונים דומים, כאשר 90% מההוראות נמצאו תקינות, אך שיעור הדוגמאות שבהן גם ההוראה וגם הפלט נכונים עמד על 68% בלבד.

מתאים ל

  • אימון מודל הוראות ברוסית

    כוונון עדין של מודלי בסיס לעבודה ברוסית לפי הנחיות מובנות.

  • סינון וניקוי דאטה סינתטי

    שימוש כבסיס גולמי לסינון ידני של דוגמאות שגויות לפני אימון.

  • בדיקת איכות של מודלי שפה

    הערכת היכולת של מודלים קיימים להתמודד עם פקודות בשפה הרוסית.

איפה זה נופל

הבעיה המרכזית כאן היא כמות השגיאות בפלטים. אם מעל 30% מהדוגמאות כוללות תשובות שגויות לפי הבדיקות של היוצר, אימון עיוור יכניס למודל שלכם הזיות וטעויות עובדתיות מובנות. המאגר נשען כולו על נתוני מרץ 2023 ומכיל רוסית בלבד, בלי שום ייצוג לעברית. בנוסף, מדובר בדאטה סינתטי שמבוסס כולו על gpt-3.5-turbo, כך שהוא משקף את מגבלות הדיוק והסגנון של המודל הזה באותה תקופה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי, אך יש לכך סייג כבד. היוצר מזהיר שתנאי השימוש של OpenAI אוסרים על פיתוח מודלים מתחרים באמצעות פלטים של gpt-3.5-turbo. אם המוצר שלכם מסחרי, מומלץ לבחון היטב את תנאי החוזה מול OpenAI.

האם הדאטהסט כולל עברית?

לא, המאגר מוגדר לשפה הרוסית בלבד. כל 29,822 ההוראות והתשובות נוצרו ברוסית ואין בו תוכן בעברית או תמיכה מובנית במשימות מקומיות.

איך נאספו הנתונים?

הנתונים נוצרו בצורה סינתטית לחלוטין באמצעות הקוד של Stanford Alpaca ושיטת self-instruct. היוצר הפעיל את המודל gpt-3.5-turbo של OpenAI כדי לייצר שאלות ותשובות ברצף, ללא איסוף של שיחות אנושיות אמיתיות.

מה האיכות של התשובות במאגר?

לפי בדיקות המדגם שהיוצר פרסם, רק 63% עד 68% מהרשומות כוללות הוראה ותשובה שנמצאו שתיהן נכונות. המשמעות היא שכמעט שליש מהנתונים עשויים להכיל מידע שגוי או הוראות פגומות.

איך טוענים

טוענים את המידע ישירות מספריית הדאטהסטים של Hugging Face דרך המזהה IlyaGusev/ru_turbo_alpaca, ללא צורך באישור גישה מיוחד או מילוי טפסים. הגישה פתוחה לחלוטין לכל משתמש.

הקבצים במאגר שמורים בפורמט ru_turbo_alpaca.jsonl.zst הדורש פריסה, לצד סקריפט טעינה ייעודי בשם ru_turbo_alpaca.py. המאגר מכיל ארבעה קבצים בלבד בסך הכל. המשימות המוגדרות עבור הנתונים הן יצירת טקסט ויצירת טקסט מטקסט, כך שהעיבוד מתמקד במיפוי קלט ההוראה ישירות אל פלט המענה הנדרש עבור אימון המודל.

from datasets import load_dataset

ds = load_dataset("IlyaGusev/ru_turbo_alpaca")

הרישיון

הרישיון המוצהר בדף הוא cc-by-4.0, שמתיר שימוש מסחרי, שינוי והפצה תחת מתן קרדיט מתאים. עם זאת, היוצר מציין במפורש שהנתונים הופקו מ־gpt-3.5-turbo, שתנאי השימוש של OpenAI אוסרים להשתמש בפלטים שלו כדי לאמן מודלים שמתחרים בה. השילוב הזה יוצר סיכון משפטי מהותי למי שבונה מודל מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗