GPT
T

typed_digital_signatures

קוד פתוח

Benjymit2025-01-13

  • digital-signatures
  • synthetic-data
  • image-classification
  • computer-vision
  • google-fonts

חבילת תמונות של חתימות דיגיטליות שנוצרו במחשב באמצעות פונטים דמויי כתב יד. היא מיועדת למי שצריך לזהות חתימות מוקלדות במסמכים כדי לאמת אותן או לפסול אותן משפטית.

  • 808,095הורדות בחודש
  • 28לייקים

מה זה

המאגר מכיל תמונות סינתטיות של חתימות מוקלדות, שמבוססות על שמות אקראיים ממאגר קוד פתוח. הטקסטים רונדרו בתוך שלושים גופנים שונים מבית גוגל פונטס, כולם בסגנונות שמחקים כתב יד, שרבוט עט, מכחול או מרקר. המטרה היא לדמות את החתימות האוטומטיות שמשתמשים מייצרים במערכות לחתימה דיגיטלית על גבי מסמכים, במקום לחתום ידנית על המסך.

המבנה פשוט מאוד ומסודר לפי תיקיות של שמות הפונטים, כמו Dancing Script או Alex Brush. בתיעוד מצוין יעד של כ־90,000 תמונות, כלומר 3,000 קבצים לכל פונט, אף שבמאגר בפועל נספרו כ־32,845 קבצים זמינים. כל רשומה היא קובץ תמונה בודד בפורמט פי אן ג'י עם מספור רץ.

מתאים ל

  • זיהוי חתימות מוקלדות

    בדיקת מסמכים כדי לגלות אם חתימה נוצרה מפונט מוכן ולא נחתמה ידנית.

  • סיווג גופנים במסמכים

    אימון מודל ראייה ממוחשבת שמזהה באיזה פונט כתב יד מתוך השלושים נעשה שימוש.

  • אימות מסמכים דיגיטליים

    סינון ראשוני בתהליכי קליטת חוזים לצורך עמידה בדרישות תאימות ורגולציה.

איפה זה נופל

החולשה העיקרית היא שמדובר בנתונים סינתטיים לחלוטין באנגלית בלבד. אין כאן שמות בעברית, אין חתימות סרוקות אמיתיות של בני אדם, ואין עיוותים של סריקה, רקעים מלוכלכים או רעשי מסמך אמיתיים. בנוסף, יש פער מספרי בין 90,000 התמונות שהכרטיס מבטיח לבין כ־32,845 קבצים שקיימים בפועל במאגר. אם אתם בונים מערכת למסמכים משפטיים ישראליים, תצטרכו לאמן בעצמכם על פונטים מקומיים ולהוסיף רעש מלאכותי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, המאגר מופץ תחת רישיון MIT שמתיר שימוש מסחרי מלא ללא הגבלה. מותר לאמן עליו מודלים פנימיים או מוצרים שנמכרים ללקוחות. התנאי היחיד הוא צירוף עותק מהרישיון ומתן קרדיט למפרסם.

האם יש בדאטהסט חתימות בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל השמות נוצרו מרשימה אקראית באנגלית והרונדרו בפונטים לטיניים מתוך גוגל פונטס. לפרויקט בעברית תצטרכו לייצר נתונים דומים בעצמכם.

איך הנתונים נאספו והופקו בפועל?

התמונות לא נאספו ממסמכים אמיתיים אלא נוצרו באופן מלאכותי לחלוטין. היוצר לקח רשימת שמות אקראיים מקוד פתוח, ורינדר אותם לתמונות באמצעות 30 פונטים שונים של כתב יד. התוצאה היא קובצי תמונה נקיים מאוד ללא רעשי רקע.

כמה קבצים יש שם בפועל ומה הגודל?

במאגר קיימים 32,845 קבצים בפורמט פי אן ג'י. התיעוד מציין שאיפה ל־90,000 תמונות, אבל בפועל יש פחות מחצי מזה. המשקל הכולל תואם להיקף של כמה עשרות אלפי תמונות קטנות.

איך טוענים

אין כאן צורך בהרשאות גישה מיוחדות או בהגדרת טוקן, המאגר פתוח לחלוטין להורדה. הנתונים לא מגיעים כקובץ חלוקה מובנה של פייטון אלא כמבנה תיקיות ישיר של קובצי תמונה, מה שאומר שאפשר למשוך אותו עם ספריית הדאטהסטס הרגילה או פשוט להוריד את התיקיות ישירות. שמות הקבצים והתיקיות הם אלה שמגדירים את התוויות לסיווג, כך שלא תמצאו כאן קובץ מטא-דאטה מורכב עם שדות טקסט נוספים.

from datasets import load_dataset

ds = load_dataset("Benjy/typed_digital_signatures")

הרישיון

המאגר משוחרר ברישיון MIT. המשמעות היא חופש מלא להשתמש בתמונות, לשנות אותן ולאמן עליהן מודלים לשימוש מסחרי או מחקרי. הדרישה היחידה היא שמירת הקרדיט והודעת הרישיון המקורית. הרישיון אינו מחייב אתכם לפתוח את הקוד של המודל שאימנתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗