GPT
Q

Quran-Tafseer

קוד פתוח

MohamedRashadapache-2.02024-09-12

המאגר מאגד 219,000 רשומות של פרשנות קוראנית בערבית מתוך 84 ספרים שונים. הוא מתאים למי שבונה כלי מחקר דתיים או מאמן מודלים שצריכים להבין טקסט אסלאמי מסורתי לעומק.

  • 135הורדות בחודש
  • 61לייקים

מה זה

הנתונים נאספו ישירות מהאתר Altafsir.com וכוללים 219,000 שורות של תוכן פרשני בערבית. כל שורה מייצגת פרשנות לפסוק מסוים, ומגיעה מאחד מתוך 84 ספרי תפסיר שונים שנכללים באוסף. המבנה הפנימי שטוח וברור, ללא חלוקה מובנית לחלקי אימון ובדיקה נפרדים, אלא כקובץ אחוד שמחולק טכנית לשלושה קטעי פארקט.

המבנה של כל רשומה פשוט ומכיל חמש עמודות בלבד. תמצאו שם את שם הסורה, את סיווג ההתגלות שלה לפי המסורת כמכית או מדינית, את הפסוק המדויק עצמו, את שם ספר התפסיר שממנו נלקח הפירוש, ואת טקסט הפרשנות המלא. הכרטיס אינו מפרט תהליכי סינון, ניקוי רעשים, או הסרת כפילויות שנעשו על הטקסט לאחר הגרידה מהאתר.

מתאים ל

  • אימון מודלים בערבית

    אימון או כוונון של מודלי שפה על ערבית קלאסית וטקסטים דתיים היסטוריים.

  • השוואת פרשנויות

    ניתוח הבדלי גישות בין 84 ספרי פרשנות שונים על אותם הפסוקים.

  • כלי מחקר אסלאמי

    בניית מנועי חיפוש ושליפת מידע עבור חוקרים ותלמידים של הקוראן.

איפה זה נופל

התוכן כולו בערבית קלאסית ואין בו שום תרגום לעברית או לאנגלית. הכרטיס לא מציין כיצד נאספו הנתונים, האם הוסרו תגיות ווב, וכיצד טופלו שיבושי סריקה. מכיוון שמדובר בספרי פרשנות היסטוריים, הטקסטים מכילים השקפות תיאולוגיות שונות ללא איזון מודרני. לפני שמשלבים את החומר במערכת ייצור, חובה לבדוק ידנית את איכות הטקסט ואת שלמות הפסוקים מול מקור מוסמך.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

רישיון המאגר המוגדר הוא apache-2.0, שמתיר שימוש מסחרי ללא תמלוגים. עם זאת, היוצר מציין שהמידע נאסף מהאתר Altafsir.com. מומלץ לבדוק את תנאי השימוש של האתר המקורי לפני שמשלבים אותו במוצר רווחי.

האם יש במאגר טקסטים בעברית?

לא. כל 219,000 הרשומות מופיעות בערבית בלבד. אין במאגר תרגומים לעברית או לשפות אחרות.

איך מחולק הדאטהסט בין קבצים?

הנתונים מגיעים בחלוקה טכנית לשלושה קובצי פארקט שונים. אין כאן חלוקה מוגדרת מראש לסט אימון וסט בדיקה, ולכן תצטרכו לפצל את הנתונים בעצמכם לפי הצורך.

מה מייחד אותו ממאגרי קוראן אחרים?

רוב המאגרים כוללים רק את פסוקי הקוראן עצמם. כאן המוקד הוא הפרשנות, עם 84 ספרים שונים שמקושרים ישירות לכל פסוק ולמקום ההתגלות שלו.

איך טוענים

אתם מושכים את המאגר ישירות מחיבור Hugging Face סטנדרטי בלי שום צורך באישור גישה או הרשמה מוקדמת. כל המידע יושב בשלושה קובצי פארקט תחת תיקיית המידע ומחולק לחלקים של רכבת הנתונים. השדות העיקריים שתעבדו איתם הם טקסט הפסוק, תוכן הפירוש ושם הספר. כדאי לשים לב שהערבית מכילה טקסטים קלאסיים מורכבים ולכן כדאי לבדוק את התאימות של הטוקנייזר שלכם לערבית מסורתית.

from datasets import load_dataset

ds = load_dataset("MohamedRashad/Quran-Tafseer")

הרישיון

המאגר פורסם ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הנתונים והפצה חופשית, כל עוד שומרים על הודעת הרישיון המקורית ומציינים את הייחוס ליוצר. מודל שתאמנו על הטקסטים האלה לא חייב להיפתח בקוד פתוח. יחד עם זאת, הטקסטים עצמם נגרדו מאתר חיצוני שמחזיק בזכויות על האוסף, מה שעלול לייצר סיכון משפטי נפרד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗