GPT
A

antidoom-mix-v1.0

קוד פתוח

LiquidAIapache-2.02026-05-02

  • antidoom
  • prompt-only
  • sharegpt
  • preference-training

אוסף של כמעט חצי מיליון פרומפטים נקיים מתשובות, שנבנה במיוחד כדי לחלץ ממודלים לולאות חזרתיות ולייצר מהן נתוני העדפה.

  • 460הורדות בחודש
  • 122לייקים

מה זה

המאגר מכיל 478,229 רשומות שכוללות פרומפטים בלבד, בלי שום תשובות נכונות, הסברים, מבחנים מוסתרים או תוויות פתרון. הרעיון הוא להריץ מודלים על השאלות האלה, לתפוס מקרים שבהם המודל נכנס ללולאות אינסופיות, ולהשתמש בפלטים האלה כדי לבנות זוגות נתונים לאימון העדפה.

התוכן נאסף מ־14 מקורות אימון שונים ומוכרים, כולל GSM8K, MATH, MMLU, PubMedQA, מאגרי קוד כמו APPS ו־Evol-CodeAlpaca, וכן תערובות מ־open-perfectblend ונתונים שחברת LiquidAI יצרה בעצמה. מכל המקורות נוקו רמזים מזהים לסיום כמו המילה Answer, וסוננו החוצה שורות שכללו שאריות ברורות של תשובות. בנוסף, הושמטו מראש סטים של מבחני הערכה ציבוריים ומקורות שלא אפשרו הפצה מסחרית ברורה.

מתאים ל

  • חילוץ לולאות כשל במודלים

    הרצת פרומפטים מורכבים במתמטיקה וקוד כדי לתפוס מצבים שבהם המודל נתקע בלולאה אינסופית.

  • בניית דאטהסט להעדפה

    יצירת זוגות פלט שמשווים בין תגובה תקינה לבין תגובה שנתקעה בלולאה לצורך אופטימיזציה.

  • הערכת עמידות לחזרתיות

    בדיקת הנטייה של מודל קיים להישבר ולחזור על עצמו במגוון רחב של תחומי ידע.

איפה זה נופל

החומר כולו באנגלית בלבד, כך שלמי שמחפש לפתור בעיות בלולאות ייצור בעברית אין מה לחפש כאן. בנוסף, אי אפשר להשתמש באוסף הזה לאימון מונחה רגיל כי אין בו תשובות נכונות בכלל. הנתונים מתאימים רק כקלט ליצירת תגובות ובדיקת התנהגות המודל מולן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. המאגר עצמו מוגדר תחת רישיון Apache-2.0 וכל המקורות המרכיבים אותו נלקחו מרישיונות מתירניים של MIT או Apache-2.0. היוצרים ניפו במכוון מקורות עם הגבלות הפצה לא ברורות.

האם המאגר כולל תוכן בעברית?

לא. הדאטהסט מוגדר ומבוסס כולו על אנגלית בלבד. אם המטרה שלכם היא טיפול בבעיות ייצור טקסט בשפה העברית, תצטרכו לתרגם את הפרומפטים או לייצר סט מקביל.

האם יש במאגר תשובות שאפשר לאמן עליהן ישירות?

לא, וזה נעשה בכוונה. היוצרים הסירו את כל תשובות הזהב, תגיות הפתרון, ההסברים והרמזים המקדימים. מטרת הקובץ היא לספק פרומפטים בלבד כדי לדגום מהם תגובות ולזהות כשלי ייצור.

מה ההבדל בין זה לבין הורדת GSM8K או MMLU ישירות?

האוסף הזה חוסך עבודת ניקוי ידנית. הוא מאגד מעל 478 אלף פרומפטים ממגוון תחומים, מסנן החוצה סטים של הערכה ומסיר תבניות שרומזות למודל איך לסיים את התשובה.

איך טוענים

הנתונים יושבים בקובץ train.jsonl בודד לצד התיעוד, ללא צורך באישור גישה מיוחד. אפשר למשוך אותו ישירות דרך הספרייה הרגילה של Hugging Face בלי הגדרות מסובכות. מאחר שמדובר בטקסט של פרומפטים בלבד בלי תשובות ארוכות, המשקל שלו נשאר קל יחסית למרות מספר השורות הגבוה.

from datasets import load_dataset

ds = load_dataset("LiquidAI/antidoom-mix-v1.0")

הרישיון

המאגר מופץ תחת רישיון Apache-2.0, שמאפשר שימוש חופשי כולל שימוש מסחרי, שינוי והפצה. כל מקורות המשנה שנכללו בתערובת הזו נבחרו ברישיונות מתירניים של MIT או Apache-2.0, כך שאין כאן מגבלות הדבקה שמחייבות שיתוף באותו רישיון עבור המודל שתאמנו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗