GPT
Z

Zenodo10K

קוד פתוח

Forcelessרישיון לא דווח2024-10-16

  • ppt
  • powerpoint
  • document
  • pdf

מאגר של מעל עשרת אלפים מצגות פאוורפוינט אמיתיות שנאספו ישירות ממאגר המחקר Zenodo. הוא מיועד למי שמפתח מודלים ליצירה, פירוק או ניתוח של שקפים מעבר לטקסט בלבד.

  • 11,388הורדות בחודש
  • 27לייקים

מה זה

המאגר מכיל קובצי פאוורפוינט אמיתיים בפורמט pptx שנאספו מזנודו עבור פרויקט PPTAgent. לא מדובר בטקסט מחולץ בלבד או בתמונות מרונדרות, אלא במצגות המקוריות כפי שחוקרים העלו אותן לרשת, כולל המבנה הפנימי של השקפים, העיצובים והאלמנטים הגרפיים.

המבנה של הקבצים מאורגן בתיקיות לפי סוג הרישיון המקורי ושנת היצירה. מתוך שמות הקבצים רואים חלוקה לרישיונות כמו Apache 2.0, BSD 3-Clause וגרסאות שונות של Creative Commons, לצד שנים כמו 2019, 2021 ו־2024. בנוסף למצגות עצמן, המאגר כולל קובץ Parquet מרכז יחיד שמחזיק את המטא-דאטה והמידע על הקבצים.

לפי כרטיס המאגר, המטרה הייתה לאסוף מצגות בעלות רישיונות מוגדרים היטב. עם זאת, הכרטיס אינו מפרט תהליכי סינון נוספים, בדיקות איכות או ניקוי שבוצעו על התוכן, כך שהמצגות משקפות חומר אקדמי גולמי ומגוון ללא עיבוד מקדים מדווח.

מתאים ל

  • אימון סוכני יצירת שקפים

    למידת המבנה, הפריסה והזרימה של מצגות אמיתיות עבור מודלים כמו PPTAgent.

  • חילוץ מבנה מתוך מצגות

    בניית מודלים שמפרקים קובצי pptx לאלמנטים לוגיים, כותרות ותיבות טקסט.

  • הערכת מודלי שקפים

    שימוש בקבצים כבנצ'מרק להשוואת איכות המבנה והעיצוב של מצגות מיוצרות.

איפה זה נופל

ההטיה המרכזית נובעת ממקור הנתונים. מדובר במצגות ממאגר אקדמי, כך שסגנון השקפים, השפה והתוכן מכוונים לכנסים מדעיים ולא למצגות שיווקיות, ארגוניות או עסקיות. שפות התוכן אינן מצוינות בכרטיס, והסיכוי למצוא שם עברית קלוש ביותר. בנוסף, חסר פירוט על איכות העיצוב, תקינות הקבצים או הימצאות מידע רגיש, ולכן אי אפשר לזרוק את החומר לאימון בלי לסנן ולבדוק ידנית את המבנה הפנימי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

למאגר עצמו אין רישיון אחיד מוצהר, מה שמונע שימוש חופשי בכולו יחד. עם זאת, הקבצים מחולקים לפי רישיונות המקור כמו אפאצ'י ו־BSD, כך שאפשר לסנן ולהשתמש רק במצגות בעלות רישיון מתאים למסחר.

האם יש במאגר מצגות בעברית?

הכרטיס לא מציין שפות כלל, אך המקור הוא זנודו הבינלאומי. רוב מוחלט של החומר באנגלית או בשפות אירופיות, ולא כדאי לבנות על המאגר הזה לצורך עיבוד עברית.

איך הנתונים נאספו?

היוצרים סרקו את אתר זנודו והורידו מעל עשרת אלפים קובצי פאוורפוינט. הקבצים סווגו ונשמרו בתיקיות לפי שנת היצירה שלהם וסוג הרישיון שבו הם פורסמו במקור.

באיזה פורמט המידע מגיע?

המאגר כולל 10,451 קבצים, רובם מצגות pptx מקוריות ששומרות על העיצוב והאלמנטים. לצד המצגות יש קובץ Parquet בודד שמרכז את המטא-דאטה של כל הפריטים.

איך טוענים

את המידע המרכז אפשר לקרוא ישירות דרך קובץ ה־Parquet שנמצא בנתיב data/pptx-00000-of-00001.parquet, לצד הורדת קובצי ה־pptx עצמם שנמצאים בתיקיות ייעודיות. המאגר מכיל 10,451 קבצים, ללא דרישה לאישור גישה מראש. קוד החילוץ מראה שהקבצים מסודרים לפי הרישיון, שנת היצירה וה־checksum של הקובץ, כך שחשוב לשים לב לשדות האלה כדי לסנן מראש רק קבצים שמתאימים למטרת הפרויקט.

from datasets import load_dataset

ds = load_dataset("Forceless/Zenodo10K")

הרישיון

למאגר כולו לא הוגדר רישיון אחיד ברמת הדף, מה שיוצר סיכון משפטי אם מסתמכים עליו כחבילה אחת. בפועל, הקבצים מחולקים בתיקיות לפי הרישיון המקורי שלהם מזנודו, כמו Apache 2.0 או CC-BY. אם אתם בונים מודל מסחרי, תצטרכו לסנן ולהשתמש רק במצגות שנמצאות תחת רישיונות שמתירים זאת במפורש, ולהימנע משימוש גורף.

הרישיון המלא ב־Hugging Face ↗