GPT
T

trismegistus-project

קוד פתוח

tekniummit2023-10-01

  • spirituality
  • occultism

מאגר הוראות ממוקד לתחומי הנסתר, המיסטיקה והתורות האזוטריות. הוא מיועד למי שרוצה לאמן מודל שיבין מושגים מורכבים במאגיה, אלכימיה או רוחניות בלי לאסוף טקסטים ידנית.

  • 124הורדות בחודש
  • 77לייקים

מה זה

המאגר מכיל בערך 10,000 זוגות של הוראה ותגובה, והוא נוצר באופן סינתטי לחלוטין באמצעות GPT מלבד תתי הנושאים שהוגדרו מראש. התוכן סובב סביב מגוון רחב של תחומים אזוטריים ורוחניים, ביניהם הרמטיציזם, העלאה באוב, דת, מדיטציה, טראנס, אלכימיה, נומרולוגיה וקריאה בקלפי טארוט. אין כאן חלוקה מפורשת לקבוצות אימון ובדיקה נפרדות, אלא אוסף שיחות שנועד לכסות ידע תיאורטי ומעשי בעולמות המיסטיקה.

המבנה של כל רשומה כולל מזהה ייחודי, את הוראת המערכת ששימשה להפעלת המודל שייצר את הטקסט, סוג המשימה, הנושא הספציפי, ומקור שמציין את רמת המומחיות. השיחות עצמן מיוצגות במערך של חילופי דברים בין אדם לבין המודל, כך שרואים במדויק את השאלה המקורית ואת התשובה שנוצרה.

מתאים ל

  • אימון בוטים לתחומי מיסטיקה

    בניית עוזרי שיחה שמתמחים במיסטיקה, קריאת טארוט והסבר מושגים בתורת הנסתר.

  • כוונון עדין למודלים קיימים

    הרחבת אוצר המילים וההבנה של מודלי שפה בנושאים רוחניים והיסטוריה אזוטרית.

  • מחקר תוכן אזוטרי סינתטי

    בדיקת האופן שבו מודלי שפה מייצרים ומנתחים ידע מתחומי האלכימיה והמאגיה.

איפה זה נופל

הנתונים כולם סינתטיים ומבוססים על מה ש־GPT ייצר בסביבות אוקטובר 2023, כך שהזיות ואי דיוקים היסטוריים בתחומי המיסטיקה הם כמעט בלתי נמנעים. המאגר כולו באנגלית בלבד, ואין בו ייצוג למושגים קבליים או אזוטריים בעברית ישירות מהמקור. בנוסף, המפרסם מזהיר במפורש שחלק מהתכנים כנראה אינם מתאימים לכל הגילאים בגלל עיסוק בנושאים אפלים כמו נקרומנסיה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

כן, הרישיון המוגדר הוא MIT שמתיר שימוש מסחרי מלא. עם זאת, מכיוון שהדאטהסט יוצר באופן סינתטי על ידי GPT, כדאי לקחת בחשבון את תנאי השימוש של החברה שיצרה את המודל המקורי.

האם המאגר כולל טקסטים בעברית או תכני קבלה מקוריים?

לא, המאגר מסומן כדובר אנגלית בלבד. כל המושגים, גם אם מקורם במסורות יהודיות או מזרחיות, נכתבו ותורגמו לאנגלית על ידי המודל הסינתטי.

מאיפה הנתונים הגיעו והאם הם נאספו מטקסטים עתיקים אמיתיים?

הטקסטים לא נסרקו מספרים היסטוריים אלא נוצרו לחלוטין בצורה סינתטית באמצעות מודל שפה. רק רשימת תתי הנושאים נבחרה מראש כדי להנחות את תהליך הייצור.

איך טוענים

טוענים את המידע ישירות מקובץ ה־JSON בשם occultexpert.json שנמצא במאגר, ללא צורך באישור גישה מיוחד. המאגר כולל שלושה קבצים בלבד ופורמט השיחות מסודר במערך conversations עם שדות from ו־value, כך שמי שמאמן מודלי שיחה בסגנון ShareGPT ימצא את המבנה הזה מוכר ומוכן לעבודה כמעט ללא עיבוד מקדים.

from datasets import load_dataset

ds = load_dataset("teknium/trismegistus-project")

הרישיון

המאגר מופץ תחת רישיון MIT, שמאפשר שימוש מסחרי, שינוי והפצה חופשית לכל מטרה, בתנאי ששומרים על תנאי הרישיון ומתן הקרדיט. הרישיון אינו דורש שיתוף של מודלים שאימנתם תחת אותו רישיון בדיוק, אבל יש לוודא שהשימוש במידע שיוצר באמצעות מודלים מסחריים תואם את מדיניות השימוש שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗