GPT
B

Bhagavad-Gita_Dataset

קוד פתוח

JDhruv14רישיון לא דווח2025-09-03

  • Spirituality
  • Mythology
  • Hinduism
  • India

קורפוס מקבילי קטן שמכיל את כל 700 הפסוקים של הבהגווד גיטה. הוא כולל את המקור בסנסקריט לצד תרגומים מסודרים להינדי ולאנגלית.

  • 272הורדות בחודש
  • 61לייקים

מה זה

המאגר הזה בנוי כולו סביב טקסט בודד, ספר הבהגווד גיטה שנשמר בספרייה הארכאולוגית המרכזית בניו דלהי. המקור נלקח ישירות מקובץ סרוק שפורסם על ידי המרכז הלאומי לאמנויות על שם אינדירה גנדי בהודו. אין כאן דגימות מורכבות מהרשת או סינון של מיליוני רשומות, אלא תמלול מדויק של יצירה היסטורית ספציפית.

המבנה מיושר ברמת הפסוק ומחבר בין שלוש שפות: סנסקריט, הינדי ואנגלית. סך הכל יש כאן 700 שורות שתואמות ל־700 הפסוקים של היצירה המקורית, בלי חלוקה מוגדרת מראש לחלקי אימון ובדיקה. כל רשומה כוללת את הפסוק במקור ותרגום מקביל בשתי השפות האחרות, מה שמספק הקבלה ישירה ונקייה מאוד בין שלושת הניסוחים.

מתאים ל

  • אימון מודל תרגום ספציפי

    כוונון עדין של מודלי שפה לתרגום מדויק בין סנסקריט, הינדי ואנגלית על טקסט קלאסי.

  • חילוץ ייצוגים ווקטוריים

    בדיקת איכות של אמבדינג רב לשוני מול טקסט מקביל זהה בשלוש שפות שונות.

  • מחקר בלשני חישובי

    השוואה מבנית וסמנטית של מונחים תאולוגיים עתיקים מול התרגומים המודרניים שלהם.

איפה זה נופל

זה קובץ של 700 שורות בלבד, כך שלא תאמנו עליו מודל שפה שלם מאפס. הוא מתאים אך ורק למשימות תרגום או חילוץ מאפיינים סביב שפת המקור הזו והסגנון הדתי העתיק שלה. עברית לא קיימת פה בכלל, הטקסט מבוסס על תרגום יחיד מספר ארכיוני אחד, ואין שום מידע על בקרת האיכות שנעשתה בזמן התמלול מהספר הסרוק.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

היוצר לא פרסם רישיון לנתונים, מה שאומר שאין הרשאה חוקית ברורה לגעת בהם. מבחינה משפטית יבשה אסור להפיץ או להשתמש בהם במוצר מסחרי. לא הייתי בונה על זה שום דבר שמייצר הכנסה עד שהיוצר יבהיר את תנאי השימוש.

כמה המאגר הזה שוקל ואיך הוא מגיע?

הוא מגיע כקובץ CSV בודד עם 700 שורות, לצד תמונה וקובץ הסבר. המשקל שלו אפסי ומסתכם בכמה עשרות קילובייטים של טקסט. אפשר להוריד ולפתוח אותו בשנייה בכל מחשב או סביבת עבודה.

האם יש בו תמיכה בשפה העברית?

אין במאגר הזה מילה אחת בעברית. השפות היחידות שקיימות בו הן סנסקריט, הינדי ואנגלית. אם אתם צריכים תרגום לעברית תצטרכו לתרגם את העמודות בעצמכם ממקור חיצוני.

איך הנתונים נאספו ונבנו בפועל?

הנתונים נלקחו מתוך ספר בשם סרימד בהגווד גיטה שנמצא בספרייה הארכאולוגית המרכזית בניו דלהי. המקור הגולמי היה קובץ PDF סרוק שהועלה לאתר ממשלתי הודי. היוצר פירק את הספר והתאים את 700 הפסוקים שורה מול שורה בשלוש השפות.

איך טוענים

אתם מושכים קובץ CSV יחיד בשם geeta_dataset.csv ישירות מהמאגר של JDhruv14 בהאגינג פייס. אין צורך בבקשת גישה מיוחדת או באישור מהיוצר, והמשקל של כל המאגר זניח לחלוטין. בתוך הקובץ תמצאו את הפסוקים המיושרים לפי שפות, כך שכל שורה מייצגת פסוק אחד בסנסקריט, הינדי ואנגלית.

from datasets import load_dataset

ds = load_dataset("JDhruv14/Bhagavad-Gita_Dataset")

הרישיון

היוצר לא הגדיר רישיון בקובץ או בעמוד הפרויקט. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין לכם היתר שימוש מפורש, בוודאי שלא למטרות מסחריות. אם תאמנו על זה מודל שמיועד למוצר, אתם לוקחים סיכון של הפרת זכויות יוצרים.

הרישיון המלא ב־Hugging Face ↗