GPT
P

Polaris-Dataset-53K

קוד פתוח

POLARIS-Projectapache-2.02025-06-12

המאגר מרכז 53 אלף בעיות חשיבה מתמטיות ולוגיות עם פתרונות ודירוג קושי מחושב. הוא מיועד למי שמאמן מודלי הסקה ורוצה לברור דוגמאות לפי סיכויי ההצלחה שלהן.

  • 3,283הורדות בחודש
  • 37לייקים

מה זה

המאגר כולל בעיות עם פתרונות וציון קושי, שמיועדות לאימון מודלי חשיבה מתקדמים במסגרת פרויקט פולאריס. הנתונים מגיעים משני מקורות קיימים ברשת: DeepScaleR-Preview-Dataset ו־AReaL-boba-Data. היוצרים לא אספו מידע גולמי מאפס אלא סיננו ואיחדו רשומות מתוך המאגרים האלה.

כל רשומה בנויה משלושה שדות בלבד. שדה הבעיה מציג את השאלה, שדה התשובה מכיל את הפתרון, ושדה הקושי מציג הערכה כמותית שנמדדה מראש. הערכת הקושי מבוססת על שיעור המעבר של הבעיה כפי שנבדק באמצעות המודל Deepseek-R1-distill-Qwen-7B, מה שמאפשר לדעת מראש עד כמה השאלה מאתגרת עבור מודלים בגודל כזה.

מתאים ל

  • אימון מודלי הסקה

    אימון מודלים קטנים על בעיות חשיבה שסוננו מראש עם פתרונות נלווים.

  • סינון דוגמאות לפי קושי

    חלוקת נתוני האימון לקבוצות על בסיס שיעור ההצלחה שהוערך ברשומה.

  • בנצ'מרק להערכת ביצועים

    בדיקת יכולת הפתרון של מודלים מול שאלות בדרגות קושי מוגדרות.

איפה זה נופל

הכרטיס קצר מאוד ולא מפרט איך בדיוק בוצע הסינון מתוך המאגרים המקוריים, אילו שפות נכללות בפנים או מה תחומי השאלות המדויקים מעבר לבעיות חשיבה. מדד הקושי נשען כולו על מודל בודד, Deepseek-R1-distill-Qwen-7B, ולכן הוא משקף את נקודות העיוורון שלו ולא מדד אובייקטיבי אוניברסלי. אין תיעוד של בדיקות ידניות לאיכות התשובות, כך שעלולות להיות שם טעויות שמודלים יספגו ישירות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0 ומאפשר שימוש מסחרי מלא. צריך רק לוודא שאתם משמרים את תנאי הרישיון והקרדיט למפתחים המקוריים.

האם המאגר כולל בעיות בשפה העברית?

הכרטיס אינו מזכיר עברית ואינו מפרט חלוקה לשפות. סביר להניח שהטקסטים באנגלית, בהתאם למאגרי המקור שעליהם הוא מבוסס.

איך חושב שדה הקושי של כל בעיה?

הקושי חושב באמצעות הרצה של המודל Deepseek-R1-distill-Qwen-7B על הבעיות ובדיקת שיעור המעבר שלו. זהו מדד אמפירי שמבוסס על ביצועי המודל הזה בלבד.

מה ההבדל בינו לבין מאגרי המקור מהם נלקח?

היוצרים ביצעו סינון מתוך DeepScaleR-Preview-Dataset ו־AReaL-boba-Data והוסיפו עמודת קושי. עם זאת, הקריטריונים המדויקים ששימשו לחיתוך לא פורסמו בכרטיס.

איך טוענים

הקובץ המרכזי polaris-data-53K.jsonl פתוח לחלוטין להורדה ואינו דורש אישור גישה מיוחד מיוצרי הפרויקט. אתם מושכים אותו ישירות דרך ספריית datasets או קוראים את שורות ה־JSON בכל שפת תכנות. השדות המרכזיים שצריך לעבד הם problem, answer ו־difficulty. שדה הקושי מאפשר לכם לסנן דוגמאות קלות מדי או קשות מדי לפני שמתחילים את שלב האימון או ההערכה.

from datasets import load_dataset

ds = load_dataset("POLARIS-Project/Polaris-Dataset-53K")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודלים שתאמנו תחת אותו הרישיון. חובה לשמור על הודעת זכויות היוצרים המקורית והצהרת הרישיון בתוצרי הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗