GPT
M

mobile-actions

קוד פתוח

googlecc-by-4.02025-12-18

  • gemma3
  • gemma
  • google
  • functiongemma
  • mobile-actions

מאגר ענק של שיחות להפעלת פונקציות מערכת באנדרואיד מתוך פקודות קוליות או טקסט. הוא מיועד למי שמאמן מודלים קטנים מאוד שצריכים לרוץ ישירות על המכשיר ולבצע פעולות בלי ענן.

  • 908הורדות בחודש
  • 280לייקים

מה זה

הרשומות מציגות תרחישים שבהם משתמש מבקש פעולה בשפה טבעית, והמודל נדרש להחזיר קריאה לפונקציה מתאימה עם הארגומנטים הנכונים. כל דוגמה כוללת הגדרה של הכלים הזמינים באותו רגע במבנה דמוי JSON Schema, יחד עם היסטוריית השיחה שמכילה את בקשת המשתמש ואת הפלט המצופה מהעוזר.

המאגר מחולק מראש לאימון ולהערכה דרך שדה ייעודי בכל רשומה, כך שלא צריך לנחש או לחלק עצמאית. המטרה המוצהרת של גוגל היא הכשרת מודלים זעירים, כמו FunctionGemma בנפח 270 מיליון פרמטרים, לתרגום פקודות משתמש ישירות לכלים של מערכת ההפעלה אנדרואיד. המפרסמים לא פירטו בכרטיס כיצד נאספו הנתונים במקור או באילו שיטות סינון השתמשו כדי לייצר את השיחות.

מתאים ל

  • אימון מודלי קריאת פונקציות

    התאמת מודלים קטנים לתרגום פקודות משתמש לקריאות API מובנות.

  • פיתוח סוכנים לאנדרואיד

    בניית רכיבי שליטה קולית שמפעילים כלי מערכת ישירות על הטלפון.

  • הערכת ביצועי מודלי קצה

    בדיקת דיוק החזרת ארגומנטים באמצעות סט הבחינה המובנה בקובץ.

איפה זה נופל

המאגר כולו מוגבל לשפה האנגלית בלבד, ואין בו שום תמיכה בעברית. אם המטרה שלכם היא להריץ פקודות מקומיות בעברית על מכשירים בארץ, תצטרכו לתרגם או לייצר דאטה מקביל. בנוסף, כל הכלים והפונקציות תפורים סביב אנדרואיד, ולכן הם לא יתאימו ישירות למי שמפתח סוכנים ל־iOS או למערכות הפעלה שולחניות. גוגל גם לא מספקת מידע על אופן יצירת הנתונים, מה שמשאיר סימן שאלה לגבי כמות הדוגמה הסינתטית מול שימוש אנושי אמיתי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. רישיון cc-by-4.0 מתיר שימוש מסחרי מוחלט, כולל אימון מודלים שנמכרים ללקוחות. החובה היחידה שלכם היא לתת ייחוס הולם למפרסמי המאגר.

האם הדאטהסט כולל פקודות בעברית?

לא, המאגר מתועד באנגלית בלבד. כל פקודות המשתמש, שמות הכלים והתיאורים מנוסחים באנגלית, כך שהוא לא יעזור ישירות בהבנת הוראות מקומיות בעברית.

איך הנתונים נאספו והורכבו?

גוגל לא ציינה בכרטיס הדאטהסט את שיטת האיסוף או הסינון. החומר מציג את מבנה השיחות המוכן בלבד, ללא פירוט אם מדובר במידע ממשתמשי אמת או בטקסט שנוצר בצורה סינתטית על ידי מודלים.

איך טוענים

הנתונים מגיעים בקובץ dataset.jsonl פשוט ופתוח להורדה, ללא צורך באישור גישה מיוחד. בגלל שמדובר בעשרות מיליוני רשומות, מומלץ לקרוא את הקובץ ישירות בסטרימינג במקום לטעון הכל לזיכרון בבת אחת. בעת העיבוד, השדות המרכזיים שמעניינים אתכם הם tools להגדרת הפונקציות, messages שמכיל את קריאת ה־tool_calls של העוזר, ושדה metadata שמגדיר אם הרשומה שייכת לסט האימון או ההערכה.

from datasets import load_dataset

ds = load_dataset("google/mobile-actions")

הרישיון

הרישיון הוא cc-by-4.0, מה שמאפשר שימוש מסחרי מלא, שינוי והפצה. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים בלי לחשוף את הקוד שלכם, ואין חובת שיתוף של נגזרות באותו רישיון. הדרישה היחידה היא מתן קרדיט מתאים לגוגל כמקור הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗