GPT
M

my_notes

קוד פתוח

merveapache-2.02023-01-21

סיכומי הרצאות ודפי נוסחאות מלימודי תואר שני במדעי הנתונים, למידת מכונה ועיבוד תמונה. זה מתאים למי שרוצה חומר גולמי של סריקות כתב יד להכנה למבחנים או לאימון OCR.

  • 4,313הורדות בחודש
  • 28לייקים

מה זה

המאגר מכיל 118 קבצים, רובם מסמכי PDF שכוללים סריקות כתב יד וסיכומים אישיים מתקופת לימודי התואר השני של היוצרת. החומרים מבוססים על קורסים אקדמיים וספרי לימוד מוכרים, ביניהם הספר של תום מיטשל בלמידת מכונה, ספר עיבוד התמונה הדיגיטלי של גונזלס, וספר מבני הנתונים והאלגוריתמים בפייתון מאת גודריץ'.

המבנה מחולק לפי נושאים ספציפיים וכולל דפי עזר במדעי הנתונים, סטטיסטיקה, למידה עמוקה, עיבוד תמונה ואלגוריתמים. יש במאגר גם תיקייה של קבצים מאוחדים שמרכזת כל נושא למסמך אחד, כולל קובץ בודד שמאגד את כלל החומרים, וכן דפי נוסחאות על הכלים של האגינג פייס.

מתאים ל

  • אימון ובדיקת מודלי OCR

    זיהוי כתב יד מסריקות PDF באיכויות משתנות בעולמות הטכנולוגיים והמתמטיים.

  • חילוץ נוסחאות ותרשימים

    אימון מערכות ראייה ממוחשבת לחילוץ דיאגרמות ונוסחאות מתוך דפי סיכום.

  • הכנה לראיונות עבודה

    חזרה מרוכזת על מושגי מפתח בלמידת מכונה ואלגוריתמים מתוך דפי נוסחאות מוכנים.

איפה זה נופל

החומר לא עבר סינון שיטתי או תיוג מקצועי. מדובר בסריקות של כתב יד אישי, ואיכות הסריקה בחלק מהדפים נמוכה, עד כדי כך שבעלת המאגר מבקשת עזרה בשיפור האיכות או בהמרה לתמונות. הטקסט ברובו באנגלית אבל כולל הערות קטנות בטורקית, אין בו מילה אחת בעברית, והוא לא מתאים כלל כבסיס ידע שלם אלא רק כרפרוף נקודתי.

שאלות
נפוצות

האם מותר להשתמש בחומרים לפרויקט מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא, כולל שינוי של הקבצים ושילובם במוצרים סגורים. התנאי העיקרי הוא שמירה על הקרדיט ועל עותק מהרישיון המקורי.

האם יש במאגר טקסט בעברית?

אין במאגר עברית בכלל. הסיכומים נכתבו באנגלית מתוך ספרי לימוד בינלאומיים, ויש פה ושם הערות שוליים קצרות בטורקית שבעלת המאגר מציינת שאפשר להתעלם מהן.

איך הנתונים נאספו ומאיפה הם הגיעו?

הקבצים הם סיכומים אישיים שכתבה סטודנטית במהלך לימודי תואר שני, לצד למידה למבחני אמצע וגמר. החלקים השונים נשענים על סילבוסים וספרי לימוד מוגדרים במדעי המחשב ועיבוד תמונה.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המאגר כולל 118 קובצי PDF, חלקם מחולקים לפי נושאים וחלקם מאוגדים לקבצים גדולים. אין כאן דאטהסט טבלאי של שורות ועמודות, אלא מסמכים וסריקות שצריך להוריד ולנתח כקבצי מדיה.

איך טוענים

לא מדובר בטבלה שפותחים בשורה אחת של קוד. המאגר מכיל קובצי PDF של סריקות כתב יד, ולכן מורידים אותו ישירות כקבצים מהמאגר בלי צורך באישור גישה מיוחד. מי שרוצה לעבוד עם הטקסט יצטרך להריץ תהליך של עיבוד תמונה או חילוץ באמצעות מודלי OCR וראייה ממוחשבת.

from datasets import load_dataset

ds = load_dataset("merve/my_notes")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי חופשי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובת שיתוף באותו רישיון עבור תוצרים, ואפשר להשתמש בחומרים לצורך אימון מודלים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗