GPT
C

LDJnr/Capybara

קוד פתוח

LDJnrapache-2.02023-12-16

  • Physics
  • Biology
  • Math
  • Chemistry
  • Culture

מאגר של שיחות רב-שלביות סינתטיות שנבנה כדי ללמד מודלים חשיבה והעמקה בלי הנימוס המעיק של צ'אטבוטים. הוא נועד למי שרוצה לאמן מודל שיחה חזק בלי לשרוף משאבים על מאות אלפי דוגמאות.

  • 1,284הורדות בחודש
  • 257לייקים

מה זה

המאגר כולל בין עשרת אלפים לעשרים אלף שיחות מרובות שלבים, עם ממוצע של מעל שלושה חילופי דברים ויותר מאלף טוקנים לשיחה. כל רשומה מבוססת על שאלות יחידות שנלקחו ממאגרים מוכרים כמו Airoboros, Know logic, EverythingLM ו־GPTeacher, לצד מאגרים פנימיים כמו Dove ו־Verified-Camel. משם, שיטה בשם Amplify-Instruct הרחיבה את השאלות האלה לשיחות מלאות ומעמיקות בנושאי מדע, תרבות פופולרית והיגיון.

הסינון כאן אגרסיבי במיוחד. היוצר ניקה לחלוטין ביטויים כמו 'כמודל שפה', התנצלויות מוסרניות, משפטים כמו 'אין לי אמונות אישיות', ואזכורים לתאריך חיתוך המידע של ספטמבר 2021. בנוסף, נערך ניקוי דליפות מול מבחני ביצועים נפוצים כמו MMLU, HumanEval ו־TruthfulQA באמצעות MinHash, כאשר הדליפה היחידה שנמצאה, מול MT-bench, נוקתה מהקובץ הסופי.

מתאים ל

  • אימון מודלי שיחה רב-שלביים

    לימוד מודלים לנהל שיחות ארוכות ומורכבות בלי לאבד את ההקשר אחרי שאלה אחת.

  • הסרת גינוני צ'אטבוט

    כוונון עדין שמנקה מהתשובות הצטדקויות, הרצאות מוסר ומשפטים פסיביים מיותרים.

  • חיזוק יכולות היגיון והסקה

    אימון על דיאלוגים שמעמיקים בנושאי מדע, לוגיקה ותרבות פופולרית.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן מילה אחת בעברית. בנוסף, מדובר במידע סינתטי שנבנה ברובו על ידי מודלים, כך שהוא עלול להכיל שגיאות עובדתיות או חישוביות. היוצר עצמו מציין שבכוונתו להיעזר בעתיד במומחים אנושיים כדי לאתר טעויות במתמטיקה ובמדעים, מה שאומר שנכון לעכשיו אי אפשר להסתמך על הדיוק המדעי בעיניים עצומות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא. צריך רק לשמור על תנאי הייחוס של הרישיון כשמפיצים את הנתונים.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר כולו מוגדר ומכיל טקסטים באנגלית בלבד. אם המטרה שלכם היא מודל שמדבר עברית, תצטרכו לתרגם אותו או לשלב מקורות נוספים.

כמה דוגמאות אימון יש בפועל?

הקובץ כולל בין עשרת אלפים לעשרים אלף שיחות מלאות. זה נפח קטן יחסית למאגרי שיחה אחרים, אך כל דוגמה ארוכה ומכילה כמה סבבי שיחה.

האם התשובות עברו בדיקת עובדות אנושית?

לא, מדובר בטקסט שנוצר בשיטות סינתטיות על בסיס זרעי תוכן קודמים. יוצר המאגר אף ציין שדרושים מתנדבים כדי לאמת דיוק מתמטי ומדעי בעתיד.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הנתיב LDJnr/Capybara, ללא צורך באישור גישה מיוחד. הקובץ המרכזי במאגר מגיע בפורמט CapybaraPure_Decontaminated.jsonl, שכולל את השיחות הנקיות מדליפות. כל רשומה מייצגת שיחה שלמה עם מספר תורות, כך שצריך לוודא שתבנית הפרומפט והטוקנייזר שלכם מוגדרים לטפל בהקשר של לפחות אלף טוקנים לשיחה.

from datasets import load_dataset

ds = load_dataset("LDJnr/Capybara")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, מאפשר לשנות את הנתונים, ולא מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו רישיון. החובה העיקרית היא מתן קרדיט ושמירה על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗