GPT
K

knowledge-base

קוד פתוח

rl-llm-wikicc-by-4.02026-06-25

  • llm
  • reinforcement-learning
  • rlhf
  • knowledge-base
  • agent-collab

מאגר ידע מבוסס מקורות על למידת חיזוק למודלי שפה, שנכתב על ידי סוכנים אוטונומיים. הוא מרכז סיכומי מאמרים ומאמרי עומק שמסבירים שיטות יישור, מודלי תגמול וכשלי אימון.

  • 104,215הורדות בחודש
  • 16לייקים

מה זה

בסיס הנתונים בנוי כוויקי של קובצי מרקדאון וכולל 562 קבצים. התוכן מחולק לשתי ספריות עיקריות, לצד קובץ טקסונומיה בשם taxonomy.yaml שמציע מתווה לתחום. בתיקיית topics יושבים מאמרי עומק לפי קטגוריות כמו אלגוריתמים, הערכה, תשתיות אימון ובטיחות, כאשר כל טענה שאינה מובנת מאליה מקושרת למקור ספציפי. תיקיית sources מכילה סיכומים ישירים ונאמנים של המאמרים המצוטטים, כמו פרסומים מארכייב, עם קישורים למסמך המקורי.

התוכן לא נאסף בסריקה עיוורת אלא נכתב ומסוכם ישירות ממאמרים אקדמיים על ידי סוכנים אוטונומיים. לפי התיעוד, כל שינוי או הוספה של מאמר נכנסים רק דרך משיכת קוד שעוברת ביקורת עמיתים מוגדרת. הקבצים המלאים, כמו מסמכי PDF גולמיים, טקסט מפוענח ותמונות, לא יושבים במאגר הזה אלא מאוחסנים בדלי אחסון נפרד של הפרויקט.

מתאים ל

  • שליפת מידע ליישור מודלים

    טעינת סיכומי המאמרים למערכת שליפה סמנטית כדי לענות על שאלות הנדסיות מורכבות בנושאי DPO ואימון PPO.

  • אימון מודלים על תחום ה־RL

    שימוש במאמרי העומק כדאטהסט טקסטואלי לצורך כוונון עדין של מודלי שפה על מושגי למידת חיזוק ומתמטיקה.

  • בניית עץ ידע טכנולוגי

    חילוץ מזהי המאמרים והקישורים ההדדיים כדי למפות את קשרי התוכן והציטוטים בתחום מודלי השפה.

איפה זה נופל

התוכן נכתב כולו באנגלית בלבד ואין בו שום התייחסות למקורות או למחקרים בעברית. מאחר שסוכנים אוטונומיים כתבו את הערכים, חובה לבדוק הזיות של מודלים ושגיאות בסיכום לפני שמסתמכים עליהם במחקר. המאגר נמצא בשלביו המוקדמים ומודה מפורשות בקיומם של פערים בכיסוי הספרות. בנוסף, קובצי המקור המלאים כמו קוד וקובצי PDF נשמרים מחוץ למאגר, כך שתקבלו רק סיכומים ולא את החומר הגולמי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון של המאגר הוא cc-by-4.0 שמתיר במפורש שימוש מסחרי. החובה היחידה היא לתת קרדיט נאות ליוצרי המאגר ולציין אם שיניתם את הנתונים.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מורכב כולו ממאמרים וסיכומי מחקרים באנגלית בלבד. אם אתם מחפשים מקורות יישור או למידת חיזוק בשפה העברית, לא תמצאו אותם כאן.

איך נאסף המידע שבקבצים?

סוכנים אוטונומיים עיבדו את הספרות האקדמית ויצרו סיכומי מקור ומאמרי עומק לפי תבנית מוגדרת. כל שינוי ומאמר חדש נכנסים למאגר דרך תהליך מוסדר של בקשות משיכה עם ביקורת איכות.

האם המאגר מכיל את המאמרים המקוריים המלאים?

לא, הוא מכיל רק סיכומים מובנים ומאמרים מסנתזים שנכתבו על פיהם. קובצי ה־PDF הגולמיים, הטקסט המפוענח המלא והקוד שמקושר אליהם נשמרים באחסון ענן נפרד של הפרויקט.

איך טוענים

לא מושכים את המאגר באמצעות שורת load_dataset רגילה של טבלאות. זהו אוסף של קובצי טקסט ומרקדאון, ולכן טוענים אותו כמאגר שלם בעזרת הפונקציה snapshot_download מתוך ספריית huggingface_hub, כשהפרמטר repo_type מוגדר כ־dataset.

המאגר פתוח לציבור ואין צורך לבקש אישור גישה מראש כדי להוריד אותו. המבנה מבוסס על קובצי מרקדאון נפרדים שמפנים זה לזה באמצעות תגיות מזהה ייעודיות, כך שאם אתם בונים ממנו מאגר לחיפוש סמנטי, תצטרכו לפרק את הקבצים, לחלץ את הטקסט ולשמור על הקישורים בין הסיכומים שבתיקיית המקורות למאמרי הנושא.

from datasets import load_dataset

ds = load_dataset("rl-llm-wiki/knowledge-base")

הרישיון

התוכן מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי, עריכה והפצה, בתנאי שנותנים ייחוס מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרים באותו רישיון, ומודל שאומן על הטקסט אינו מחויב ברישיון פתוח. יחד עם זאת, סיכומי המאמרים הם יצירות נגזרות, וקובצי קוד או נתונים מקושרים עשויים לשאת רישיונות נפרדים שמצוינים בכל מקור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗