GPT
W

webcode2m

קוד פתוח

xcodemindcc-by-4.02024-04-01

  • code

מאגר ענק של צילומי אתרים אמיתיים יחד עם קוד המקור שלהם ותיבות המיקום של הרכיבים. הוא נבנה כדי לאמן מודלים רב-מודאליים להמיר עיצוב ויזואלי לקוד אתר תקין.

  • 4,313הורדות בחודש
  • 48לייקים

מה זה

במאגר יש שניים נקודה חמישה שישה מיליון דוגמאות שנאספו ישירות מרחבי הרשת, ומכאן גם שמו הנוסף Vision2UI. כל רשומה כוללת צילום מסך של עמוד האינטרנט, קוד HTML ו־CSS תואם, ומידע פריסה מפורט שכולל תיבות תוחמות שמגדירות את הגודל, המיקום וההיררכיה של כל רכיב בדף. בנוסף נשמרים ממדי התמונה בפיקסלים, גיבוב תמונה ומספר הטוקנים של הקוד לפי מפענח של GPT-2.

איסוף המידע התבסס על אתרים חיים, וכדי לנפות תוכן גרוע היוצרים הפעילו מודל ניקוד ייעודי. המודל סינן החוצה עמודים עם בעיות אסתטיות או רכיבים שבורים וחסרים, וצירף לכל רשומה ציון איכות מספרי. הטקסט המוצג בכל עמוד עבר זיהוי שפה אוטומטי כדי לתייג את שפת התוכן, בנפרד מקוד המקור עצמו.

מתאים ל

  • אימון מודל לעיצוב אתרים

    יצירת קוד HTML ו־CSS מלא ישירות מתוך תמונת מסך או קובץ עיצוב של עמוד אינטרנט.

  • זיהוי פריסה והיררכיה בדף

    חיזוי מיקומי אלמנטים ותיבות תוחמות מתוך תמונה בלבד כדי להבין את מבנה העמוד.

  • הערכת ביצועי מודלים

    בדיקת איכות קוד של מודלים רב-מודאליים מול נתוני אמת מהרשת ומדד כמו TreeBLEU.

איפה זה נופל

החומר הגיע ישירות מסריקת אתרים ברשת, ולמרות הסינון האוטומטי היוצרים מזהירים מפורשות שיש בפנים תוכן בלתי הולם, כולל אלימות ותוכן למבוגרים. מבחינת שפות, מודל הזיהוי תומך בעשרים שפות ספציפיות בלבד, ועברית אינה אחת מהן. המשמעות היא שדפים בעברית או בערבית מורכבת עלולים להכיל תיוג שגוי או להציג בעיות יישור שלא נבדקו, ולכן אימון עליו למוצר מקומי ידרוש בדיקה ידנית קפדנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ראוי למחברים המקוריים לפי דרישות הרישיון.

האם יש במאגר תמיכה בעברית?

המאגר אינו תומך רשמית בעברית. מודל השפות ששימש לסיווג התוכן הוגדר לעשרים שפות בלבד, ביניהן ערבית, אנגלית ורוסית, אך עברית אינה נכללת ברשימה.

איך נאספו הנתונים ומה כולל הסינון?

הנתונים נאספו ישירות מאתרים ברשת וסוננו באמצעות מודל ניקוד שלמד לזהות פגמים אסתטיים ורכיבים חסרים. למרות זאת, היוצרים מבהירים שעדיין עשויים להימצא בו דפים לא הולמים.

מה ההבדל בין המאגר הזה לגרסת purified?

גרסת webcode2m_purified היא גרסה משנית של אותו מאגר שממנה סוננו רוב התכנים האלימים והמיניים. אם אתם מאמנים מודל שמיועד למשתמשי קצה, מומלץ לבחון אותה כדי להקטין סיכונים.

איך טוענים

הנתונים מחולקים על פני אלפיים שישים ושבעה קבצי Parquet תחת תיקיית data, וזמינים להורדה חופשית בלי צורך בבקשת גישה מיוחדת. כדי לחסוך זמן ורוחב פס, מומלץ לקרוא רק את השדות הנחוצים כמו תמונה, טקסט ה־HTML וה־CSS, ותיבות המיקום. אם אתם רוצים להימנע מתוכן בעייתי מראש, כדאי לשקול להשתמש בגרסה המסוננת שהיוצרים מציעים בנפרד בשם webcode2m_purified.

from datasets import load_dataset

ds = load_dataset("xcodemind/webcode2m")

הרישיון

המאגר מפורסם תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. הרישיון אינו דורש שיתוף תחת אותו רישיון, כך שאימון מודל על הנתונים אינו מחייב אתכם לפתוח את המשקולות או את קוד המקור של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗