GPT
C

CIDAR

קוד פתוח

arbmlapache-2.02024-01-20

  • Instruction

עשרת אלפים הוראות ותשובות בערבית לאימון מודלי שפה, עם דגש על התאמה תרבותית. מתאים למי שבונה מודל בערבית ורוצה להימנע מתרגום מכונה יבש.

  • 334הורדות בחודש
  • 57לייקים

מה זה

המאגר מכיל עשרת אלפים צמדים של הוראה ותשובה בשפה הערבית. המקורות מורכבים משני חלקים עיקריים: כ־9,109 דוגמאות נלקחו ממאגר Alpagasus ותורגמו לערבית באמצעות ChatGPT, ועוד כ־891 דוגמאות של הוראות דקדוק מקוריות נאספו ישירות מהאתר Ask the teacher של רשת אל ג'זירה.

כל עשרת אלפים הרשומות עברו בדיקה וסינון על ידי צוות של כ־12 סוקרים אנושיים, במטרה לוודא איכות לשונית והתאמה תרבותית. המבנה עצמו פשוט וכולל שלושה שדות בלבד: אינדקס מספרי מזהה, שדה instruction שמכיל את ההנחיה בערבית, ושדה output שכולל את התשובה המלאה.

מתאים ל

  • אימון מודלים בערבית

    כיוונון עדין של מודלי שפה לעיבוד הוראות ותשובות בערבית תקנית.

  • מענה לשאלות דקדוק

    אימון מערכות על ניתוח תחבירי, שאלות בלשנות וכללי דקדוק בערבית.

  • הערכת תאימות תרבותית

    בדיקת יכולת המודל לייצר תשובות שמתאימות להקשר חברתי ודתי ערבי.

איפה זה נופל

החלק הגדול במאגר מבוסס על תרגום מכונה של ChatGPT ממאגר קיים באנגלית, כך שעלולות להופיע שגיאות תרגום או מבנים תחביריים זרים למרות הבדיקה האנושית. היוצרים מצהירים במפורש שהמאגר מיועד למחקר בלבד, ומדגישים שאין ערובה לכך שכל התשובות תואמות לחלוטין לערכי האסלאם והתרבות הערבית. אין כאן נתונים בעברית בכלל, והשימוש מתאים רק למי שעובד על מודלים בערבית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

טכנית כן, הרישיון המוגדר הוא Apache 2.0 שמתיר שימוש מסחרי מלא באימון מודלים. יחד עם זאת, יוצרי המאגר ציינו בתיאור שהוא מיועד לצורכי מחקר בלבד, ולכן משפטית יש כאן סתירה שחשוב להכיר לפני שילוב במוצר.

האם יש במאגר נתונים בעברית?

לא. המאגר כולו בערבית בלבד. הוא מיועד למשימות בשפה הערבית ומכיל שאלות, תשובות והוראות בדקדוק ערבי.

איך הנתונים נאספו ונבדקו?

רוב הדאטה, כ־9,109 דוגמאות, נלקח ממאגר Alpagasus ותורגם לערבית באמצעות ChatGPT. עוד 891 דוגמאות נאספו מאתר לימודי של אל ג'זירה, וכל עשרת אלפים הרשומות עברו בדיקה אנושית של כ־12 סוקרים.

כמה המאגר שוקל והאם קשה להוריד אותו?

המאגר קטן מאוד וכולל עשרת אלפים רשומות בלבד בקובץ parquet אחד. ההורדה אורכת שניות ספורות ואינה דורשת משאבי מחשוב מיוחדים או אישור גישה.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של Hugging Face בפקודה load_dataset עם השם arbml/CIDAR. אין צורך באישור גישה מוקדם, הקובץ פתוח לחלוטין להורדה ומגיע בפורמט parquet יחיד שנשמר בתוך תיקיית data.

מבחינת משאבים, מדובר במאגר קל מאוד של עשרת אלפים שורות בלבד, כך שהוא נטען תוך שניות בודדות לתוך הזיכרון בלי לדרוש תשתית מיוחדת. בעבודה מול הנתונים צריך לגשת בעיקר לשדות instruction ו־output לצורך אימון או הערכה.

from datasets import load_dataset

ds = load_dataset("arbml/CIDAR")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים מסחריים עליהם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. למרות זאת, יש לשים לב שהחוקרים ביקשו בכרטיס להגביל את השימוש למחקר, פער שקיים בין ההצהרה לבין תנאי הרישיון הרשמי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗