GPT
S

Shamela4_Full_DB

קוד פתוח

AuthenticIlmmit2026-05-19

  • islamic-studies
  • arabic
  • classical-arabic
  • quran
  • hadith

מאגר טקסטואלי מלא של הגרסה הרביעית מספריית אל-שאמלה, המכיל 8,589 ספרים בערבית קלאסית. הוא מיועד למי שצריך קורפוס היסטורי עצום ומובנה של מדעי האסלאם, עם חלוקה מדויקת לעמודים ולפרקים.

  • 18,195הורדות בחודש
  • 25לייקים

מה זה

המאגר מציג חילוץ מלא של ספריית אל-שאמלה מתוך בסיס נתונים פנימי של לוקין ו־Sqlite. הוא מחולק לפי תיקיות של 41 קטגוריות שונות, ובהן ספרי חדית', הלכה אסלאמית, תיאולוגיה, שפה ודקדוק, היסטוריה וספרות. סך הכל תמצאו כאן 7,611,186 עמודים שחולצו מ־8,589 ספרים, בלי שאף ספר נפסל בתהליך.

המבנה מאורגן ברמת הספר הבודד. לכל כותר יש קובץ מטא-דאטה עם שמות המחברים, תאריכי פטירה לפי הלוח ההיג'רי ופרטי מהדורה, קובץ תוכן עניינים היררכי, קובץ מניפסט לאימות נתונים, וקובץ שורות שמכיל את גוף הטקסט עצמו. רשומת עמוד בודדת מחזיקה את תוכן הדף המקורי, הערות שוליים מקושרות, ומספרי עמוד רציפים ומודפסים לצד תגיות מבניות בסיסיות.

מתאים ל

  • אימון מודלי שפה בערבית

    טיוב ואימון של מודלי שפה על ערבית קלאסית, תחביר היסטורי ואוצר מילים דתי.

  • אחזור מידע והצלבת מקורות

    חיפוש סמנטי, זיהוי שושלות מוסרים של חדית' ובניית מערכות שליפה ייעודיות לטקסט אסלאמי.

  • ניתוח בלשני היסטורי

    חילוץ שורשים ובדיקת קשרי גומלין וציטוטים בין חיבורים מימי הביניים בעזרת מילון השורשים המצורף.

איפה זה נופל

הטקסט גולמי ומכיל שרידי HTML כמו תגיות span או טבלאות, מעברי שורה בפורמט carraige return בלבד, ותמונות inline בקידוד base64 שדורשות ניקוי מוקדם. חלק מהספרים מסומנים ככאלה עם הגבלות זכויות גישה, וקיימת הטיה מובנית לעולמות הדת וההלכה האסלאמית. המאגר מתאים בלעדית לערבית קלאסית, ואין בו שום תוכן בעברית או בערבית מודרנית מדוברת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

עדיף שלא. אף שהרישיון בעמוד הוא MIT, כרטיס המאגר מציין במפורש שהטקסטים מיועדים למחקר ולשימוש אישי בלבד, בשל זכויות היוצרים של מהדירי הספרים והמוציאים לאור של המהדורות הדיגיטליות.

כמה שוקל המאגר וכמה משאבים נדרשים כדי להוריד אותו?

הטקסט תופס כ־19 גיגה-בייט, ותיקיית הנתונים הנוספים שוקלת כ־177 מגה-בייט. המאגר מורכב מיותר מ־34,000 קבצים בפורמטים שונים, כך שנוח לעבוד איתו בטעינה של קבצים נבחרים או בהזרמה ישירה בלי להוריד את כולו בבת אחת.

האם יש במאגר טקסטים בעברית?

אין בו שום תוכן בעברית. כל הנתונים, המטא-דאטה והספרים כתובים אך ורק בערבית קלאסית ונוגעים לספרות הדתית וההיסטורית של האסלאם.

איך הנתונים נאספו ונבנו בפועל?

הטקסט חולץ ב־26 באפריל 2026 מתוך בסיס הנתונים המקורי של תוכנת אל-שאמלה 4, שהתבסס על שילוב של Sqlite ו־Lucene. החילוץ נעשה באמצעות כלי ייעודי שרץ מול שרת PostgreSQL 16 בלי להשמיט אף ספר.

איך טוענים

הנפח הכולל עומד על כ־19 גיגה-בייט של טקסט בערבית, בתוספת תיקיית מטא-דאטה ששוקלת כ־177 מגה-בייט. המאגר ציבורי ופתוח להורדה בלי צורך באישור גישה. אפשר לטעון אותו באמצעות ספריית datasets עם חלוקת full, או לקרוא ישירות קובצי Parquet ו־JSONL ספציפיים. השדות הקריטיים לעבודה הם body שמכיל את הטקסט, page_id, וכן book_id שמקשר לפרטי המהדורה והמחבר.

from datasets import load_dataset

ds = load_dataset("AuthenticIlm/Shamela4_Full_DB")

הרישיון

המטא-דאטה מדווח על רישיון MIT, אך גוף הטקסט עצמו מציין תנאים אחרים לגמרי שנובעים מזכויות המהדירים והמוציאים לאור של המהדורות המודפסות. היוצרים מתירים שימוש אישי ומחקרי בלבד, ומבקשים לכבד את זכויות היוצרים על העריכות. בגלל הסתירה הזו והתלות בספריית המקור, לא מומלץ לאמן מודל מסחרי סגור על הנתונים האלה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗