GPT
L

LongPage

קוד פתוח

Pageshift-Entertainmentcc-by-4.0,other2025-09-04

  • long-context
  • cot
  • reasoning
  • creative-writing
  • Cold start reasoning data

ספרים שלמים מפרויקט גוטנברג לצד שלבי תכנון וחשיבה היררכיים שיוצרו באמצעות מודלים. מתאים למי שרוצה לאמן מודלים על כתיבה עלילתית ארוכה עם הנמקה מובנית.

  • 708הורדות בחודש
  • 153לייקים

מה זה

המאגר כולל ספרים שלמים באנגלית שחולקו לרמות של סצנה, פרק וספר שלם. כל רשומה כוללת טקסט מלא של פרקים, פירוק לסצנות, תקצירים נקודתיים, חוקי עולם, ארכיטיפים של דמויות, וקטורי ציונים של קצב ומאפייני סצנה, ופרומפטים סינתטיים של משתמשים. המקור הראשוני הוא ספרים בנחלת הכלל מתוך רשימת ההורדות המובילות של פרויקט גוטנברג.

העיבוד נעשה בשני שלבים עיקריים אחרי ניקוי שפה והסרת הערות שוליים באמצעות Qwen3-32B. השלב הראשון עיבד 300 ספרים כזרע התחלתי בעזרת סוכן איטרטיבי רב-שלבי. השלב השני עיבד 5,700 ספרים נוספים באמצעות מודלי כלי של Qwen3-14B שאומנו בזיקוק על תוצרי השלב הראשון.

מתאים ל

  • אימון SFT לכתיבה ארוכה

    אימון מודלים על פריסת עלילה, בניית דמויות וכתיבת ספרים שלמים לפי תוכנית עבודה.

  • הכוונת מודל בזמן הסקה

    הזנת שלבי החשיבה כתוכנית עבודה מפורטת להמשך כתיבה לפי חוקי עולם וקשתות עלילה.

  • הערכת עקביות של מודלים

    בדיקת יכולת המודל להיצמד לקווי מתאר, עובדות על דמויות והתקדמות עלילתית לאורך זמן.

איפה זה נופל

כל שלבי התכנון וההנמקה נוצרו באופן סינתטי על ידי מודלים, ולכן ייתכנו סתירות או פרטים מומצאים שלא מופיעים בספר המקורי. המאגר קיים באנגלית בלבד, ואין בו מטא-דאטה מקורי של מחברים, תאריכי פרסום או מזהי גוטנברג. היצירות הן היסטוריות ועשויות להכיל סטריאוטיפים, קללות ותכנים פוגעניים ללא סינון תוכן או תיוג מקדים. בנוסף, חלוקת הנתונים כוללת רק סט אימון, ואורכי הספרים נעים עד מעל 600 אלף טוקנים, מה שעלול לייקר את זמני הריצה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, טקסט הספרים נמצא בנחלת הכלל ושכבת החשיבה הסינתטית זמינה תחת רישיון CC-BY-4.0 שמתיר שימוש מסחרי עם מתן ייחוס. עם זאת, יוצרי המאגר מציינים כי הנתונים מסופקים ללא אחריות ואינם מיועדים לייצור ללא בדיקה משפטית ובטיחותית עצמאית.

האם הדאטהסט כולל ספרים בעברית?

לא. המאגר עבר סינון שהשאיר ספרים בשפה האנגלית בלבד, כך שאין בו תכנים או תמיכה מובנית בעברית.

איך נאספו ועובדו הטקסטים?

הטקסטים הורדו מפרויקט גוטנברג, נוקו מחומרי מעטפת בעזרת Qwen3-32B, וסוננו לספרים בעלי ארבעה פרקים ומעלה. לאחר מכן נבנתה שכבת תכנון היררכית: 300 ספרים ראשונים עובדו עם סוכן רב-שלבי, ו־5,700 ספרים נוספים עובדו על ידי מודלי Qwen3-14B שזוקקו מהשלב הראשון.

האם המאגר מחולק לסט בדיקה ואימון?

לא, המאגר מפורסם בפיצול יחיד של אימון בלבד. מי שרוצה לבצע הערכה צריך לפצל את הרשומות בעצמו לפני תחילת העבודה.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets בפורמט Parquet, בחלוקת train בלבד וללא צורך באישור גישה. הנתונים מאוחסנים כמחרוזת JSON בעמודת content, ויש לפענח אותה כדי לחלץ את השדות. המאגר מכיל סקריפט בשם exampel_compose.py שמפרק כל רשומה לשלושה רכיבים: פרומפט, תהליך חשיבה וטקסט הספר.

from datasets import load_dataset

ds = load_dataset("Pageshift-Entertainment/LongPage")

הרישיון

הרישיון מפוצל לשניים. תוכן הספרים עצמם נמצא בנחלת הכלל. שכבת החשיבה והמטא-דאטה הסינתטי שמפיקה פונקציית העיבוד מפורסמת תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי ושינויים, אך מחייב מתן קרדיט מתאים. מודל שאומן על הנתונים אינו מחויב בשיתוף תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗