GPT
T

tagengo-gpt4

קוד פתוח

lightblueapache-2.02024-04-22

המאגר מרכז מעל 75,000 שיחות קצרות ב־74 שפות שנלקחו ממשתמשים אמיתיים ונענו מחדש על ידי GPT-4. הוא נבנה כדי לתת מענה למחסור בנתוני שיחה איכותיים מחוץ לאנגלית.

  • 114הורדות בחודש
  • 62לייקים

מה זה

הנתונים מבוססים על פרומפטים אנושיים שנשלפו מתוך המאגר lmsys-chat-1m. היוצרים סיננו החוצה שיחות שנחסמו בבקרת התוכן של OpenAI, הודעות אנונימיות, שאלות שעוסקות בעצם היות המודל מכונה, וטקסטים שזיהוי השפה שלהם קיבל ביטחון נמוך מ־80 אחוזים. בנוסף, הם הורידו פרומפטים שביחד עם התשובה המקורית עברו 512 טוקנים כדי לחסוך עלויות, וניפו כפילויות דומות בעזרת מודל שיקוע.

עבור כל פרומפט ששרד את הסינון, הופקה תשובה חדשה מול גרסת gpt-4-0125-preview. כל רשומה מייצגת חילוף יחיד של שאלה ותשובה אחת בלבד, ללא המשך שיחה רב שלבי. החלוקה הפנימית נשענת על קובץ אימון יחיד שמכיל את כלל השפות, ללא פיצול מובנה לולידציה או מבחן.

מתאים ל

  • אימון הוראות רב לשוני

    כוונון עדין של מודלים קטנים למענה על פקודות קצרות בשפות אירופיות מובילות.

  • בדיקת איכות סינתטית

    השוואת ביצועי מודלי שפה שונים מול תשובות איכותיות שנוצרו על ידי GPT-4.

  • סינון וניתוח פרומפטים

    חקר סוגי שאלות נפוצות של משתמשים אמיתיים במגוון שפות שונות.

איפה זה נופל

למרות ההבטחה ל־74 שפות, החלוקה לא מאוזנת בעליל. אנגלית ופורטוגזית מחזיקות מעל 28,000 שיחות יחד, בעוד שפות רבות קיבלו פחות מעשר שיחות, כך שהן לא באמת שימושיות לאימון. עברית כוללת 120 דוגמאות בלבד, כמות זעומה שמתאימה אולי לבדיקה נקודתית ולא ללימוד שפה. בנוסף, חיתוך הטוקנים השאיר רק שאלות ותשובות קצרות מאוד, ומדובר בסיבוב שיחה בודד ללא שום הקשר מתמשך.

שאלות
נפוצות

האם המאגר מתאים לאימון מודל בעברית?

לא ממש, יש בו רק 120 שיחות בעברית. הכמות הזו קטנה מדי כדי להשפיע על יכולות המודל, אך היא יכולה לשמש כמדגם זעיר לבדיקת הבנה בסיסית.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הרישיון הרשמי הוא apache-2.0 שמאפשר שימוש מסחרי חופשי, אך יש מלכוד. התוכן הופק באמצעות OpenAI, ולפי תנאי השימוש שלהם אסור לאמן מודלים מתחרים על בסיס התוצרים שלהם.

איך נאספו השאלות והתשובות?

השאלות נלקחו מאינטראקציות אמיתיות מתוך lmsys-chat-1m ועברו סינון קפדני של כפילויות ואורכים. לאחר מכן, הריצו את השאלות מול gpt-4-0125-preview כדי לייצר את כל התשובות מחדש.

האם השיחות כוללות דיאלוג מתמשך?

לא, כל הרשומות מורכבות מחילוף בודד של שאלה ותשובה. בנוסף, הוגבלה סך כל השיחה ל־512 טוקנים כדי לצמצם עלויות הפקה, כך שהטקסטים קצרים יחסית.

איך טוענים

טוענים את המאגר ישירות בעזרת ספריית datasets של Hugging Face דרך המזהה lightblue/tagengo-gpt4. הנתונים שמורים בקובץ Parquet בודד בשם train-00000-of-00001.parquet, כך שאין צורך באישור גישה מיוחד או בהורדה מורכבת של מספר חלקים. ברשומות תמצאו את השיחות והשפה המזוהה, ומומלץ לסנן לפי עמודת השפה לפני שמתחילים לאמן, במיוחד אם אתם מכוונים לשפות ספציפיות.

from datasets import load_dataset

ds = load_dataset("lightblue/tagengo-gpt4")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה ללא תשלום תמלוגים, כל עוד שומרים על הודעת הרישיון והקרדיט למפתחים. עם זאת, מכיוון שהתשובות נוצרו באמצעות GPT-4, תנאי השימוש של OpenAI עדיין חלים ברקע ואוסרים להשתמש בפלט כדי לאמן מודלים שמתחרים בהם ישירות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗