GPT
C

computer-use-large

קוד פתוח

markov-aicc-by-4.02026-03-12

  • screen-recording
  • computer-use
  • software-tutorials
  • gui
  • desktop

המאגר מרכז הקלטות מסך נקיות של שימוש בתוכנות מקצועיות, בלי דיבורים או פתיחים מסביב. מי שבונה סוכנים להפעלת ממשקי מחשב מקבל כאן אלפי שעות תצוגה מתוכנות עבודה אמיתיות.

  • 40,965הורדות בחודש
  • 193לייקים

מה זה

בפנים יש 48,478 סרטוני וידאו שמסתכמים בכ־12,300 שעות צפייה. הם נאספו מהרשת ומראים תהליכי עבודה אמיתיים בשש תוכנות מוכרות: בלנדר, פוטושופ, אוטוקאד, אקסל, סיילספורס ו־VS Code. כל סרטון עבר חיתוך ידני או אוטומטי כדי להעיף פתיחים, סיומות, מעברים וצילומים של אנשים מדברים, וגם פס הקול הוסר לגמרי.

הקבצים מחולקים לתיקיות לפי שם התוכנה. בגלל מגבלות טכניות של פלטפורמת האחסון, קטגוריות גדולות כמו בלנדר, פוטושופ ואוטוקאד פוצלו לשתי תיקיות שונות. בכל תיקייה כזו יושב קובץ מטא-דאטה שכולל את שם קובץ הווידאו, שם התוכנה, משך הסרטון בשניות וכמות המקטעים הרציפים שחוברו בו.

מתאים ל

  • אימון סוכני מחשב

    לימוד מודלים איך נראית עבודה שוטפת בתוכנות מקצועיות לפי ממשק המשתמש.

  • הבנת ממשקי משתמש

    ניתוח תנועות חלונות, תפריטים ופקדים באפליקציות שולחניות מורכבות.

  • סיווג וידאו טכני

    זיהוי תוכנות ופעולות ספציפיות מתוך צילומי מסך נקיים ללא שמע.

איפה זה נופל

הנתונים מוגבלים לשש תוכנות בלבד, והחלוקה ביניהן לא שווה. בעוד שלבלנדר יש מעל 3,600 שעות, לתוכנה כמו VS Code יש רק 304 סרטונים ו־127 שעות. בנוסף, השפה המוגדרת היא אנגלית בלבד, וכל האודיו נמחק. המאגר מכיל רק פיקסלים של וידאו ללא רישום מדויק של פעולות עכבר ומקלדת, כך שמי שבונה סוכן יצטרך לחלץ את הפעולות עצמן מתוך התמונה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, הרישיון הוא CC-BY-4.0 שמתיר שימוש מסחרי חופשי. אתם רק חייבים לתת קרדיט למפרסמים כנדרש ברישיון. המודל שיוצא מאימון על החומר הזה שייך לכם.

כמה שטח אחסון הדבר הזה דורש?

המאגר כולל 48,478 סרטוני וידאו ובסך הכל 96,962 קבצים, בהיקף של כ־12,300 שעות. מדובר בנפח עצום שמצריך שטחי אחסון ייעודיים וחיבור רשת חזק. אפשר להוריד קטגוריות בודדות לפי הצורך כדי לחסוך מקום.

האם יש בסרטונים ממשקים או נתונים בעברית?

לא, המאגר מוגדר רשמית באנגלית בלבד. הסרטונים מציגים תוכנות מקצועיות בינלאומיות וכל הטקסטים והממשקים הם בשפה האנגלית. לא תמצאו כאן תוכן מקומי.

מאיפה הגיעו הסרטונים ואיך ניקו אותם?

הסרטונים לוקטו מהרשת מתוך הדגמות שימוש בתוכנות. כל הקטעים שלא הציגו מסך נטו, כמו פרצופים של אנשים שמדברים, פתיחים ומעברים, נחתכו החוצה. בנוסף, כל פסי הקול הוסרו לחלוטין.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון. אפשר למשוך הכל יחד או לבחור קטגוריה בודדת כמו בלנדר כדי לחסוך מקום. אין צורך לבקש אישור גישה מיוחד, אבל קחו בחשבון שמדובר ביותר מ־96 אלף קבצים בפורמט MP4 ובאלפי שעות וידאו, כך שזה דורש נפח אחסון מקומי רציני ותעבורת רשת כבדה. המטא-דאטה מגיע בפורמט jsonl וכולל את שדות משך הווידאו ומספר המקטעים.

from datasets import load_dataset

ds = load_dataset("markov-ai/computer-use-large")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. המשמעות היא שמותר להשתמש בו לצרכים מחקריים ומסחריים, כולל אימון מודלים, ואין חובה לשתף את התוצרים באותו רישיון. התנאי היחיד הוא לתת קרדיט הולם ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗