GPT
A

AtomBlock-WebUI

קוד פתוח

ZhihaoNancc-by-nc-sa-4.02026-04-18

  • agent
  • ui
  • web
  • yolo

המאגר מכיל צילומי מסך סינתטיים של דפי אינטרנט מלאים עם תיוגי תיחום מדויקים. הוא פותר את בעיית חוסר הדיוק בתיוג אוטומטי של אתרים אמיתיים.

  • 821הורדות בחודש
  • 47לייקים

מה זה

הנתונים מורכבים מ־9,683 צילומי מסך של דפי אינטרנט באורך מלא, עם מעל 1.3 מיליון תיבות תוחמות שמסווגות ל־14 קטגוריות. הרכיבים מחולקים לאלמנטים בסיסיים כמו כפתורים, קישורים ושדות קלט, לצד בלוקים מבניים כמו תפריטי ניווט, עמודות צד וכותרות תחתונות. קישורים לבדם מהווים כמעט מחצית מכלל התיוגים במאגר, בעוד שאלמנטים כמו טבלאות מופיעים רק 697 פעמים.

הבנייה נעשתה בצורה סינתטית לחלוטין. החוקרים השתמשו בצילומי מסך מתוך Mind2Web כהנחיות מבניות, והזינו אותם למודל Qwen3.6-plus שיצר קוד HTML עם מחלקות ייעודיות לזיהוי. לתוך הקוד הוזרקו תמונות אמיתיות מתוך CC3M באמצעות חיפוש סמנטי לפי תיאורים, כדי שהדפים לא ייראו ריקים.

בסיום, דפדפן Playwright רינדר את הקוד, וקואורדינטות הפיקסלים נשלפו ישירות מתוך ה־DOM באמצעות קריאות JavaScript של getBoundingClientRect. המאגר מחולק מראש לסט אימון של 6,906 דפים, לצד סטי אימות ובדיקה של 1,388 ו־1,389 דפים בהתאמה, תוך הפרדה מבוססת דומיינים.

מתאים ל

  • אימון מודלי זיהוי רכיבי UI

    זיהוי כפתורים, שדות קלט ותפריטים בממשקי ווב עבור סוכני אוטומציה ובדיקות תוכנה.

  • פילוח מבני של דפי אינטרנט

    חלוקת צילומי מסך של אתרים לחלקים לוגיים כמו תפריטי ניווט, כותרות תחתונות ועמודות צד.

  • הערכת ביצועי מודלי ראייה

    בדיקת הדיוק של מודלי Vision בזיהוי אלמנטים גרפיים קטנים וצפופים בתוך צילומי מסך מלאים.

איפה זה נופל

זהו דאטהסט סינתטי לחלוטין, וזה החיסרון המרכזי שלו. קוד ה־HTML שנוצר על ידי מודל שפה נקי ומסודר מדי, וחסר בו הבלגן המאפיין אתרי פרודקשן אמיתיים, שכוללים שכבות עמוקות של תגיות גנריות ועומס ויזואלי חריג. בנוסף, קיימת אי התאמה סמנטית בין התמונות המוזרקות לבין הטקסט סביבן בחלק מהעמודים. הדאטהסט מוגבל לאנגלית בלבד, ואינו כולל שפות מימין לשמאל כמו עברית, כך שאינו משקף ממשקים מקומיים. חוסר האיזון הקיצוני בין המחלקות דורש התייחסות מיוחדת באלגוריתם, שכן רכיבים כמו כפתורי רדיו וטבלאות כמעט ואינם מיוצגים ביחס לקישורים ולתמונות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 4.0, שמתיר שימוש מחקרי ולא מסחרי בלבד. בנוסף, הרישיון דורש שכל שינוי או תוצר יישאר תחת אותו רישיון בדיוק, כך שאי אפשר להטמיע מודל שאומן עליו בקוד קנייני סגור.

האם הדאטהסט מתאים לממשקים בעברית?

המאגר מוגדר לשפה האנגלית בלבד. כל הדפים נוצרו במבנה משמאל לימין ולא נבדקו על כיווניות RTL או גופנים עבריים, מה שיגרור פגיעה בביצועים על אתרים מקומיים.

איך המאגר פותר את בעיית הדיוק בתיחום רכיבים?

במקום להסתמך על תיוג ידני או ניתוח היוריסטי של עץ ה־DOM שלעיתים מזייף במיקומים, הדפים רונדרו בדפדפן Playwright. הקואורדינטות נשלפו ישירות מהדפדפן באמצעות פונקציות מדידה פנימיות של האלמנטים המרונדרים בפועל.

למה מומלץ לבטל אוגמנטציית Mosaic באימון?

חיבור של ארבע תמונות שונות לתמונה אחת שובר את ההיגיון המרחבי של ממשק המשתמש. אלמנטים קטנים וצפופים כמו כפתורים ואייקונים מאבדים את ההקשר שלהם בתוך הדף, מה שפוגע בדיוק הזיהוי.

איך טוענים

המאגר כולל 23 קבצים ואינו דורש אישור גישה. הוא מחולק לתיקיות מסודרות המכילות קובצי HTML גולמיים, תמונות מוזרקות, צילומי מסך מלאים בפורמט PNG, ותיקיית yolo-dataset מוכנה לאימון עם קובץ הגדרות data.yaml. קואורדינטות התיחום מנורמלות לערכים בין אפס לאחד לפי ממדי התמונה. לפני שמריצים אימון עם ספריות כמו Ultralytics, צריך להגדיר רוחב תמונה קבוע ולבטל הרחבת נתונים מסוג mosaic, כיוון שהיא מפרקת את המבנה ההגיוני של ממשקי משתמש ופוגעת בדיוק בזיהוי רכיבים קטנים.

from datasets import load_dataset

ds = load_dataset("ZhihaoNan/AtomBlock-WebUI")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC-SA 4.0 המיועד אך ורק למחקר ולא לשימוש מסחרי. חובה לתת קרדיט ליוצרים, וכל יצירה נגזרת חייבת להיות מופצת תחת אותם תנאי רישיון בדיוק. אי אפשר לאמן עליו מודלים למוצרים מסחריים. בנוסף, חלות הגבלות רישיון RAIL שמקורן ב־Mind2Web, האוסרות שימוש בנתונים לצורכי אוטומציה זדונית, דיוג או יצירה מטעה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗