GPT
L

loong

קוד פתוח

camel-aimit2025-03-31

  • reasoning
  • problem-solving
  • project-loong
  • multi-domain
  • mathematics

מאגר שאלות ותשובות מנומקות במדעים מדויקים ובתכנות, שנבנה כדי לבדוק יכולות הסקת מסקנות במודלים. אם אתם מחפשים דאטה איכותי לחידוד יכולות חשיבה מורכבות, כאן תמצאו פתרונות מפורטים לפי תחומים.

  • 1,615הורדות בחודש
  • 64לייקים

מה זה

המאגר כולל בעיות שונות המיועדות למשימות מענה על שאלות, ומחולק לתחומים מקצועיים מוגדרים. בין הנושאים תמצאו מתמטיקה מתקדמת, פיזיקה, כימיה, ביולוגיה חישובית, פיננסים, תורת הגרפים, לוגיקה, אופטימיזציה, אבטחה, רפואה ותכנות. כל רשומה כוללת את ניסוח הבעיה, הסבר מפורט שמציג את דרך הפתרון, התשובה הסופית, ומטא דאטה שמכיל מזהה ותיוג התחום.

הנתונים מאורגנים בתיקיות נפרדות לכל תחום, כאשר בכל אחד מהם קיימת חלוקה מובנית לסט אימון ולסט בדיקה. היוצרים לא ציינו בדף המאגר מאיזה מקורות חיצוניים נאספו השאלות או באיזה אופן התבצע הסינון שלהן, מעבר לעובדה שמדובר בחלק מיוזמה לבדיקת אתחול עצמי של מודלי חשיבה מתוך נתוני בסיס קטנים.

מתאים ל

  • אימון מודלים להסקה לוגית

    לימוד מודלים לפתור בעיות מורכבות שלב אחר שלב באמצעות שדה הנימוק המפורט.

  • הערכת ביצועים במדעים

    בדיקת יכולות המודל במתמטיקה מתקדמת, פיזיקה וכימיה על גבי סטי המבחן המוכנים.

  • חידוד פתרון בעיות קוד

    אימון על שאלות תכנות ואופטימיזציה שכוללות הסבר על הדרך לתשובה הסופית.

איפה זה נופל

המאגר זמין בשפה האנגלית בלבד, כך שהוא לא יעזור ישירות למי שמפתח מודל ייעודי לעברית. בנוסף, התיעוד לא חושף מאיפה הגיעו הבעיות, מי כתב או בדק את הפתרונות המפורטים, והאם נעשה שימוש במודלים אחרים כדי לייצר אותם. לפני שמשלבים את המידע באימון, תצטרכו לדגום ידנית את שרשרת ההסברים כדי לוודא שאין בה הזיות או טעויות מקצועיות בתחומים רגישים כמו רפואה או אבטחה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר פורסם תחת רישיון MIT שמאפשר שימוש מסחרי מלא ללא הגבלה על המודלים שתאמנו. הדרישה היחידה היא לכלול את הצהרת זכויות היוצרים והרישיון המקורי.

האם המאגר כולל תוכן בעברית?

לא, הנתונים מתועדים כולם בשפה האנגלית בלבד. אם אתם זקוקים לחומרים בעברית תצטרכו לתרגם את השאלות וההסברים או להשתמש במאגרים אחרים.

מאיפה נאספו הנתונים ואיך אימתו אותם?

הכרטיס של המאגר לא מפרט את מקורות המידע או את תהליך הסינון והבדיקה. ידוע רק שהפרויקט בוחן למידה עצמית של מודלים מתוך דאטה ראשוני קטן ואיכותי.

איך ניגשים לנתונים בפועל?

הגישה מתבצעת ישירות דרך פייתון עם פקודת load_dataset, כאשר יש לציין את התחום המבוקש מתוך הרשימה. אין צורך לבקש אישור גישה מיוחד והנתונים נמשכים מקובצי parquet.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה של פייתון, כאשר מעבירים את המזהה camel-ai/loong ואת שם התחום הספציפי שרוצים, למשל advanced_math. המאגר פתוח לגישה חופשית ללא צורך בהרשאה מוקדמת. הקבצים שמורים בפורמט parquet ומחולקים לסט אימון ולסט מבחן. השדות המרכזיים שתרצו למשוך לטובת המשימה הם ניסוח הבעיה, שרשרת הנימוק והפתרון הסופי.

from datasets import load_dataset

ds = load_dataset("camel-ai/loong")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לפצל אותו ולאמן עליו מודלים חופשיים או מסחריים בלי דרישה לשתף את התוצרים באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שמשתמשת בנתונים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗