GPT
T

TACO

קוד פתוח

BAAIapache-2.02023-12-20

  • code

המאגר מרכז מעל עשרים ושישה אלף אתגרי תכנות עם פתרונות פייתון ומאות מקרי בדיקה. הוא נועד למי שרוצה לבחון יכולת יצירת קוד אלגוריתמי לפי הגדרות מורכבות של סיבוכיות ורמות קושי שונות.

  • 8,078הורדות בחודש
  • 142לייקים

מה זה

המאגר מחולק לשני חלקים, אימון עם 25,443 בעיות וחלק בדיקה שמכיל 1,000 בעיות. כל רשומה כוללת את ניסוח השאלה באנגלית, פתרונות בפייתון, קוד התחלתי, ומחרוזת JSON עם קלטים ופלטים לבדיקת הרצה. בסט הבדיקה יש בממוצע כ־202 מקרי בדיקה לכל אתגר, ולכולם יש פתרונות מאומתים.

היוצרים אספו את הבעיות מאתרי תחרויות ואתגרים כמו LeetCode, Codeforces, AtCoder, HackerEarth ו־GeeksforGeeks. חלק מהחומרים הגיעו ישירות ממאגרים קיימים כמו APPS ו־CodeContest של DeepMind. כל בעיה מתוייגת ידנית לפי אלגוריתמים, תחומי ידע, מגבלות זמן וזיכרון, סיבוכיות זמן ומקום רצויה, ורמת קושי שנעה בין EASY ל־VERY_HARD.

מתאים ל

  • בנצ׳מרק ליצירת קוד מורכב

    הרצת בדיקות השוואה למודלי שפה על סט הבדיקה שכולל מעל 200 טסטים לכל בעיה ורמות קושי קיצוניות.

  • אימון אלגוריתמי ממוקד

    כיוונון מודלים על נושאים ספציפיים כמו תכנות דינמי או מבני נתונים על ידי סינון שדה skill_types.

  • בדיקת יעילות וסיבוכיות

    הערכת היכולת של מודל לעמוד במגבלות זמן וזיכרון באמצעות שדות ה־Expected Complexity.

איפה זה נופל

הבעיות מנוסחות באנגלית בלבד והפתרונות מוגבלים לפייתון, כך שהוא לא יעזור לבחינת שפות תכנות אחרות. חלק מהשאלות כוללות תמונות, אך השדה picture_num רק מציין כמות ולא מספק את הקבצים עצמם, מה שעלול לשבור בעיות שמסתמכות על תרשים. בנוסף, המפתחים מודים שמעמד זכויות היוצרים של חלק מהאתרים, כמו HackerRank, אינו ברור להם, מה שמייצר סיכון משפטי באימון מודלים מסחריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר של המאגר הוא Apache 2.0 שמאפשר שימוש מסחרי מלא. הבעיה היא שהיוצרים אספו בעיות מאתרים חיצוניים ומציינים במפורש שהסטטוס המשפטי של תכנים מאתרים כמו HackerRank אינו ידוע להם. שימוש מסחרי עלול לחשוף אתכם לתביעות מצד אותם אתרים.

האם יש במאגר תמיכה בעברית?

לא, כל השאלות וההסברים כתובים באנגלית בלבד. הפתרונות כתובים כולם בשפת פייתון.

כמה שוקל המאגר ואיך מקבלים אליו גישה?

המאגר פתוח לציבור ללא צורך בהרשמה או אישור גישה. הוא מחולק ל־23 קבצי Parquet שמכילים בסך הכל 26,443 רשומות, ונטען ישירות דרך ספריית datasets.

במה TACO שונה ממאגרי קוד ישנים יותר כמו APPS?

הוא כולל בעיות שנאספו ממגוון רחב יותר של אתרי תחרויות, ומכיל סט בדיקה עשיר יותר עם כ־202 מקרי קצה בממוצע לכל בעיה. בנוסף הוא כולל תיוגים ידניים של מגבלות סיבוכיות זמן ומקום, ומאפשר סינון מובנה לפי מיומנויות אלגוריתמיות מדויקות.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה datasets של Hugging Face בפקודה load_dataset עם השם BAAI/TACO. הנתונים מאוחסנים ב־23 קבצי Parquet ואינם דורשים אישור גישה מראש. אפשר לסנן ישירות בטעינה לפי רמת קושי בעזרת הפרמטר difficulties או לפי מיומנויות ספציפיות כמו תכנות דינמי ומיון דרך הפרמטר skills. השדות המרכזיים לעבודה הם question, solutions, ו־input_output שמחייב פענוח של מחרוזת ה־JSON כדי לחלץ את הקלטים והפלטים.

from datasets import load_dataset

ds = load_dataset("BAAI/TACO")

הרישיון

המאגר מופץ ברישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה בלי לחייב פתיחת קוד. עם זאת, התוכן נאסף מאתרים ומאגרים שונים שחלקם פעלו תחת רישיונות MIT או CC BY 4.0, וחלקם נגרדו ללא רישיון ברור כמו HackerRank. אימון מודל עלול לחשוף אתכם לסיכוני זכויות יוצרים של המקורות שמהם נלקחו השאלות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗