GPT
A

Arabic_Function_Calling

קוד פתוח

HeshamHaroonapache-2.02025-11-27

  • function-calling
  • tool-use
  • arabic
  • nlp
  • msa

ערכה ייעודית לאימון מודלים על הפעלת פונקציות וכלים בחמשה להגים של השפה הערבית. היא מכילה מעל 50,000 דוגמאות שנבנו במקור עבור שירותים מקומיים בעולם הערבי, ללא תרגום מאנגלית.

  • 130הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל 50,810 רשומות שמחולקות לערכות אימון ומבחן. 45,734 מהדוגמאות דורשות קריאה לפונקציה מתוך 36 פונקציות מוגדרות מראש, ו־5,076 הן דוגמאות שליליות של שאלות כלליות שלא אמורות להפעיל כלי חיצוני. המבנה מותאם לעבודה ישירה עם מודלים ותומך בפורמט של OpenAI, כאשר כל רשומה כוללת שאילתה בערבית, תרגום לאנגלית, שם הפונקציה המיועדת, ארגומנטים לחילוץ, הלהג, התחום וסימון האם נדרשת פעולה.

התוכן מכסה שמונה תחומים ספציפיים למזרח התיכון וצפון אפריקה: שירותי דת אסלאמיים, שירותים ממשלתיים, בנקאות ופיננסים, מסחר אלקטרוני, נסיעות, בריאות, מזג אוויר וכלים שימושיים. תהליך היצירה שילב 500 דוגמאות בסיס שנכתבו ידנית, הרחבה שלהן באמצעות שיטת Self-Instruct עם GPT-4o על גבי Azure, ריבוי ללהגים שונים, וסינון שכלל בדיקות תקינות והסרת כפילויות.

מתאים ל

  • אימון סוכנים בערבית

    פיין-טיונינג למודלים פתוחים לצורך חילוץ פרמטרים והפעלת API משאילתות בערבית מדוברת.

  • מבחן ביצועים לכלים

    הערכת היכולת של מודלי שפה לזהות נכון מתי להפעיל פונקציה ומתי לסרב, על פני חמישה להגים.

  • בוטים ממשלתיים ופיננסיים

    בניית ממשקי שיחה לאזרחים במדינות המפרץ ומצרים לבירור סטטוס ויזה, המרת מטבע או זמני תפילה.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי GPT-4o בטמפרטורה של 0.9, כך שהם נושאים את ההטיות של המודל וחלק מערכי הארגומנטים מומצאים לגמרי. קיים חוסר איזון בולט בין הלהגים: הלהג המגרבי מהווה רק 4.1% מהדוגמאות, לעומת ערבית ספרותית שמהווה 30.8% ולהג מפרצי עם 26.1%. בנוסף, אין במאגר עברית בכלל, ומי שמפתח עוזר אישי רב-לשוני יצטרך מקורות נפרדים. הכרטיס מזהיר מפורשות שלא להשתמש בזה למערכות רפואיות, משפטיות או החלטות פיננסיות ללא אימות מקיף.

שאלות
נפוצות

האם הדאטהסט מתאים לפיתוח מערכות בעברית?

לא, המאגר מתמקד כולו בערבית בחמישה להגים ובערבית ספרותית, עם תרגום לאנגלית בלבד. אין בו דוגמאות בעברית ואי אפשר להשתמש בו ישירות לאימון כלים עבור משתמשים ישראלים, אלא אם המערכת מיועדת ספציפית לדוברי ערבית באזור.

מותר להשתמש בנתונים במוצר מסחרי?

כן, רישיון Apache 2.0 מתיר שימוש מסחרי, שינוי והפצה של הנתונים והמודלים שנבנו עליהם. החובה היחידה היא לצרף את תנאי הרישיון המקורי ולתת קרדיט ליוצר.

מאיפה הגיעו הנתונים והאם הם אמיתיים?

הנתונים אינם שיחות של משתמשי קצה אמיתיים אלא מידע סינתטי שנוצר באמצעות Azure OpenAI GPT-4o. התהליך התבסס על 500 דוגמאות ראשוניות שנכתבו ביד והורחבו אוטומטית ל־50,810 רשומות, כך שחלק מהנתונים והערכים בפרמטרים הם פיקטיביים לחלוטין.

איך הוא מתמודד עם להגים שונים של השפה?

המאגר מחולק לחמישה להגים: ספרותית (30.8%), מפרצית (26.1%), מצרית (23.9%), שאמית (15.1%) ומגרבית (4.1%). בהערכות של יוצר המאגר, דיוק הזיהוי היה הגבוה ביותר במצרית ומפרצית (מעל 75%), ונמוך משמעותית בספרותית ומגרבית (סביב 64% עד 67%).

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face ללא צורך באישורי גישה או מפתחות. המאגר מכיל שמונה קבצים, כולל קובצי Parquet מוכנים ל־train ו־test, קובצי jsonl מקבילים, וקובץ functions.json שמגדיר את מבנה הפונקציות. השדות הקריטיים לעיבוד הם query_ar שמכיל את הטקסט בלהג המקורי, arguments שמכיל את הפרמטרים שחולצו בפורמט אובייקט, ו־requires_function שמלמד את המודל מתי להימנע מהפעלת כלים מיותרים.

from datasets import load_dataset

ds = load_dataset("HeshamHaroon/Arabic_Function_Calling")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי והפצה. מותר לאמן עליו מודלים לצרכים פנימיים או מוצרים מסחריים בלי חובה לחשוף את הקוד או לשחרר את המודל באותו רישיון. הדרישה העיקרית היא מתן קרדיט ליוצר ושמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗