GPT
S

s1K

קוד פתוח

simplescalingapache-2.02025-01-14

אלף שאלות מורכבות ומגוונות עם שרשראות חשיבה ופתרונות שזוקקו ממודל החשיבה של ג'מיני. המאגר מיועד למי שרוצה לאמן יכולות הסקה בלי להחזיק מאגרי ענק.

  • 11,584הורדות בחודש
  • 241לייקים

מה זה

המאגר כולל בדיוק אלף דוגמאות של שאלות קשות ומגוונות לצד פתרונות מלאים. כל רשומה מורכבת מהשאלה המקורית, פתרון האמת, ומסלול החשיבה שנוצר באמצעות זיקוק ממודל החשיבה של ג'מיני. המידע מחולק לפיצולים בצורה מינימלית ומכיל רק קובץ אימון יחיד.

המבנה של כל דוגמה כולל שדות ברורים. יש בה את קטגוריית החשיבה הראשית, מקור השאלה והקטגוריה שלו מתוך הדאטהסט המקורי, מטא דאטה נוסף שנשמר מהמקור, עקבות החשיבה של המודל, והניסיון שהופק בפועל. השדה של שרשרת החשיבה הישירה מוגדר כריק, והתהליך מרוכז כולו תחת שדה מסלולי החשיבה שמגיע כרשימה באורך קבוע של איבר אחד.

מתאים ל

  • אימון יכולת חשיבה

    כוונון עדין של מודלים קטנים ליצירת שרשרת חשיבה מפורטת בפתרון בעיות קשות.

  • מחקר זיקוק ידע

    בדיקת ההשפעה של דאטהסטים קטנים ואיכותיים על ביצועי מודל בזמן בדיקה.

  • הערכת תהליכי הסקה

    השוואת מסלולי חשיבה של מודלים עצמאיים מול הפתרונות של ג'מיני.

איפה זה נופל

מדובר באלף דוגמאות בלבד. זה מעט מאוד חומר, והוא מתאים בעיקר למיקוד או לניסויי זיקוק ולא לאימון רחב מאפס. הדאטהסט נשען כולו על שאלות שנאספו ממקורות קיימים ועל פלטים סינתטיים של מודל יחיד, כך שכל הטיה או שגיאה עובדתית שג'מיני מייצר במסלול החשיבה שלו מחלחלת ישירות למודל שלכם. הכרטיס לא מציין תמיכה בעברית, ולפי אופי המקורות מדובר בתוכן באנגלית בלבד. אם המוצר שלכם פונה למשתמש המקומי, תצטרכו לבדוק את התנהגות המודל בעברית בנפרד.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

הרישיון הרשמי בעמוד הוא אפאצ'י שתיים אפס, שמתיר שימוש מסחרי מלא ללא חובת פתיחת קוד. עם זאת, התוכן מבוסס על זיקוק פלטים ממודל מסחרי של ג'מיני, ולכן יש לבדוק אם תנאי השימוש של ספק המודל מגבילים אימון מודלים מתחרים.

כמה המאגר גדול ואיך הוא נראה מבחינת קבצים?

הוא קל מאוד ומכיל בסך הכל אלף רשומות. המידע שמור בקובץ פרקט בודד, מה שמאפשר הורדה כמעט מיידית וטעינה מהירה בזיכרון בלי שום צורך בתשתיות אחסון כבדות.

האם יש במאגר שאלות בעברית?

הכרטיס לא מדווח על נתונים בעברית, וכלל המקורות המוזכרים מבוססים על דאטהסטים בינלאומיים באנגלית. לא הייתי בונה עליו לאימון ישיר לשפה המקומית ללא הוספת שכבת נתונים ייעודית.

מה מקור הנתונים ואיך יצרו אותם?

השאלות נאספו ממאגרי שאלות קשים ומגוונים, ועברו הרחבה עם שרשראות חשיבה שחולצו ישירות ממודל החשיבה של ג'מיני. כל רשומה כוללת את השאלה, פתרון האמת המקורי, והמענה המנומק שנשמר תחת שדה ייעודי.

איך טוענים

טוענים את המידע ישירות באמצעות פקודת הטעינה הרגילה של ספריית הדאטהסטים מפייתון. אין כאן תהליך אישור גישה והמאגר פתוח לחלוטין. הוא מגיע בקובץ פרקט יחיד, כך שההורדה מהירה מאוד וכמעט לא תופסת מקום בדיסק. השדות שתרצו להתמקד בהם באימון הם השאלה, פתרון האמת, ומסלולי החשיבה שמחזיקים את הנימוקים שזוקקו מג'מיני.

from datasets import load_dataset

ds = load_dataset("simplescaling/s1K")

הרישיון

המאגר פורסם תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במערכות סגורות, בתנאי שאתם שומרים על הודעת זכויות היוצרים והרישיון המקורי. הרישיון חל על קובץ הנתונים עצמו, אך כשמדובר בנתונים שזוקקו ממודל קנייני כדאי לזכור את תנאי השימוש של ספק המודל המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗