GPT
E

english_quotes

קוד פתוח

Abirateרישיון לא דווח2022-03-02

המאגר מרכז ציטוטים באנגלית שנאספו מאתר גודרידס יחד עם שמות הכותבים ותגיות נושא. הוא מתאים למי שרוצה לאמן מודל לסיווג טקסט לפי נושאים או לחילול משפטים קצרים בסגנון מסוים.

  • 4,381הורדות בחודש
  • 109לייקים

מה זה

כל רשומה במאגר מורכבת משלושה שדות בלבד: הטקסט של הציטוט עצמו, שם המחבר, ומערך תגיות שמתאר את הנושאים שלו. הנתונים נאספו ישירות מעמודי הציטוטים של אתר גודרידס באמצעות סקריפט פייתון שמשתמש בספריות ביוטיפול סופ וריקווסטס.

הסינון הראשוני שהיוצר ביצע היה בסיסי למדי. נמחקו מהאוסף ציטוטים שלא היו להם תגיות בכלל, והוסרה התגית הספציפית שציינה שהציטוט חסר מקור מאחר שלא הוסיפה מידע על הנושא. מעבר לזה, המידע נשמר בצורתו המקורית.

אין כאן חלוקה מובנית לסט אימון, בדיקה או וולידציה. כל הנתונים יושבים במקשה אחת תחת קובץ יחיד, כך שאת החלוקה והערבוב תצטרכו לעשות לבד בקוד לפני שמתחילים לעבוד.

מתאים ל

  • סיווג טקסט מרובה תוויות

    אימון מודל לחזות תגיות נושא או מחברים מתוך טקסט הציטוט בלבד.

  • אימון מודל לחילול ציטוטים

    כוונון עדין של מודלי שפה ליצירת פתגמים או משפטים קצרים לפי סגנון כותב.

  • ניתוח סגנון כתיבה

    בדיקת מאפיינים לשוניים של מחברים שונים על בסיס הטקסטים שנאספו.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על מה שמשתמשי גודרידס העלו ודירגו, מה שמייצר הטיה ברורה לציטוטים פופולריים מהתרבות המערבית. אין במאגר עברית כלל. התגיות אינן מבוקרות אלא תלויות בבחירת הגולשים באתר, מה שעלול להוביל לחוסר עקביות בסיווג נושאים. בנוסף, מדובר בסריקת רשת ממרץ 2022 ללא עדכונים שוטפים, כך שציטוטים חדשים לא מופיעים כאן.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא. המאגר מכיל אך ורק ציטוטים באנגלית שנאספו מהגרסה האנגלית של אתר גודרידס. אם אתם צריכים נתונים בעברית, תצטרכו לחפש מקור אחר או לתרגם את הטקסטים באופן עצמאי.

מותר להשתמש בזה לפרויקט מסחרי?

המצב המשפטי כאן מורכב ולא חד משמעי. בעמוד המאגר מופיע שלא דווח רישיון, אך בתיעוד מוזכר רישיון CC-BY 4.0. מעבר לכך, התוכן עצמו מורכב מציטוטים של יוצרים שונים שנלקחו בסריקה מגודרידס, ולכן שימוש מסחרי עלול לחשוף אתכם לתביעות זכויות יוצרים של הכותבים המקוריים.

איך הנתונים נאספו ונוקו?

היוצר השתמש בסקריפט פייתון שסרק את עמודי הציטוטים באמצעות הספריות requests ו־BeautifulSoup. הניקוי כלל רק מחיקה של רשומות ללא תגיות והסרה של התגית הספציפית שציינה שאין מקור לציטוט.

האם הדאטהסט מחולק לסט אימון ובדיקה?

לא. כל הציטוטים נשמרו כקובץ אחד ללא חלוקה מראש. לפני שתתחילו לעבוד תצטרכו לבצע פיצול ידני באמצעות פונקציות כמו train_test_split של האגינג פייס.

איך טוענים

המאגר מופץ כקובץ jsonl לצד מסמך התיעוד שלו, כך שטוענים אותו ישירות דרך ספריית הדאטהסטס של האגינג פייס ללא צורך בהרשמה מיוחדת או בקשת אישור מראש. הרשומות קלות מאוד לעיבוד וכוללות את המפתחות quote, author ו־tags. לפני שמתחילים להריץ אימון, תצטרכו לפצל את הבלוק היחיד לקבוצות אימון ובדיקה באמצעות מתודות כמו train_test_split.

from datasets import load_dataset

ds = load_dataset("Abirate/english_quotes")

הרישיון

במטא דאטה של המאגר מצוין שלא דווח רישיון, אבל בטקסט התיעוד היוצר ציין רישיון קריאייטיב קומונס ייחוס 4.0. הסתירה הזו דורשת זהירות. בנוסף, הטקסטים עצמם הם ציטוטים שנאספו בסריקה מאתר מסחרי, כך שזכויות היוצרים של הטקסטים המקוריים שייכות לכותבים שלהם ולא ברור אם מותר להשתמש בהם במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗