GPT
O

open-schematics

קוד פתוח

bshadacc-by-4.02025-12-17

  • electronics
  • schematics
  • kicad
  • hardware
  • pcb

עשרות אלפי שרטוטים אלקטרוניים וקבצי מעגלים מודפסים עם תמונות מרונדרות ומטא-דאטה מובנה. זה מתאים למי שרוצה לאמן מודלים על תכנון חומרה וחיבור בין שרטוט לעריכת מעגל.

  • 11,087הורדות בחודש
  • 185לייקים

מה זה

כל רשומה מייצגת שרטוט סכמטי יחיד מתוך פרויקט חומרה, ומכילה את קובץ המקור, תמונה מרונדרת שלו, וקבצי המעגל המודפס ששייכים לאותו פרויקט. החומר נסרק וממשיך להיאסף אוטונומית מהרשת מתוך מאגרי קוד פתוח ציבוריים. הפורמטים הנתמכים הם קבצי קיקאד מודרניים וישנים, וכן קבצי אלטיום דיזיינר.

בפועל בוצעו כמה סינונים לפני הכניסה למאגר. קבצי קיקאד ריקים לגמרי הוסרו, קבצי מעגלים ששוקלים מעל עשרה מגה-בייט נזרקו החוצה, ובפרויקטים עמוסים שיש בהם מעל עשרים קבצי מעגל נשמרו רק העשרים עם התמונות המפורטות ביותר. בנוסף, חולצו שמות הרכיבים ונוצר ייצוג במבנה ג'ייסון ויאמל עבור קבצי קיקאד מודרניים.

מתאים ל

  • אימון מודלים לתכנון מעגלים

    יצירת שרטוטים סכמטיים מטקסט או השלמה אוטומטית של חיבורים הנדסיים לפי נתוני קוד וקובצי מקור.

  • זיהוי רכיבים מתמונות שרטוט

    אימון ראייה ממוחשבת לחילוץ סמלים, רכיבים וקשרים חשמליים מתוך תמונות סכמטיקה מרונדרות.

  • מיפוי בין סכמטיקה למעגל מודפס

    למידה רב-מודאלית של הקשר בין התרשים הלוגי לבין המיקום הפיזי של הקווים והרכיבים על גבי הלוח.

איפה זה נופל

חלק גדול מהנתונים לא שלם. הייצוג המבני בג'ייסון ורשימות הרכיבים קיימים רק בכ־85% מהשורות, באותם קבצים שהגיעו מגרסאות קיקאד חדשות. בקבצי אלטיום יש רק טקסט גולמי. בנוסף, ליותר ממחצית מקבצי המעגלים המודפסים אין תמונה מרונדרת, ולעשירית מהשרטוטים אין תמונה כלל. אין פה סינון איכות הנדסי, שמות הרכיבים לא אחידים בין פרויקטים שונים, והשפה היא אנגלית בלבד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון של המאגר עצמו מתיר שימוש מסחרי תחת מתן קרדיט. הבעיה היא שהפרויקטים נסרקו מהרשת ויש להם רישיונות מקור משלהם, שחלקם עשויים להגביל שימוש מסחרי. לפני שמשלבים נתונים במוצר סופי, צריך לבדוק את הרישיון המקורי לפי שדה המאגר.

כמה המאגר שוקל בפועל והאם צריך חומרה מיוחדת?

המאגר כולל 942 קבצי פארקט ועשרות אלפי רשומות, חלקן כוללות תמונות מרונדרות של שרטוטים ולוחות. המשקל הכולל כבד מאוד ודורש נפח אחסון משמעותי אם מורידים את הכל יחד. לעבודה יעילה עדיף להזרים את הנתונים ישירות או לסנן את קבצי התמונות אם צריך רק את הטקסט.

האם יש במאגר שרטוטים או טקסטים בעברית?

לא, השפה המוגדרת במאגר היא אנגלית בלבד. כל שמות הרכיבים, התיאורים ושדות המטא-דאטה מבוססים על פרויקטים הנדסיים שנאספו מהרשת הבינלאומית באנגלית.

איך הנתונים נאספו ומאיפה הם מגיעים?

המערכת של יוצר המאגר סורקת את הרשת באופן אוטונומי ומאתרת פרויקטי חומרה ציבוריים. מכל פרויקט מחולצים קבצי המקור של הסכמטיקה והמעגל, מרונדרות תמונות, ומחולצים שמות רכיבים מקבצי קיקאד.

איך טוענים

הנתונים מחולקים למאות קבצי פארקט במאגר, סך הכל 942 קבצים, כך שלא מורידים הכל בקובץ בודד. הגישה פתוחה לגמרי ללא צורך באישור מיוחד. הטעינה נעשית כרגיל בספריית הדאטהסטס, אך חשוב לשים לב לשדות התמונות שמכילים קבצי פי אן ג'י ודורשים מקום ונפח זיכרון משמעותי בזמן עיבוד. אם אתם עובדים רק על המבנה הלוגי, אפשר להסתפק בשדות הטקסט של הסכמטיקה והג'ייסון.

from datasets import load_dataset

ds = load_dataset("bshada/open-schematics")

הרישיון

המאגר פורסם ברישיון קריאייטיב קומונס 4.0 ייחוס. זה אומר שמותר להשתמש בו לצרכים מסחריים ולאמן עליו מודלים, בתנאי שנותנים קרדיט ליוצר. יחד עם זאת, הקבצים נאספו ממאגרים ציבוריים שונים ברשת, והיוצר מבהיר שצריך לציית גם לרישיונות המקוריים של כל פרויקט שנכלל בפנים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗