GPT
S

sudoku-extreme

קוד פתוח

sapientincרישיון לא דווח2024-10-16

מאגר שמקבץ לוחות סודוקו קלים וקשים במיוחד, עם פתרון יחיד מובטח. הוא מיועד למי שרוצה לבחון יכולות הסקה לוגית ופתרון אילוצים מורכבים במודלים.

  • 3,003הורדות בחודש
  • 34לייקים

מה זה

המאגר כולל מיליוני לוחות סודוקו שנאספו מקהילת הסודוקו, כולל הפורום enjoysudoku ומבחני ביצועים של tdoku. החלוקה הפנימית מורכבת מ־1.1 מיליון חידות קלות ממקורות כמו קאגל, ועוד 3.1 מיליון חידות קשות שמגיעות מאוספים היסטוריים ומדיונים על הלוחות המאתגרים ביותר שנמצאו.

היוצרים ביצעו ניקוי כפילויות מלא, וערבבו אקראית שורות, עמודות, בלוקים וספרות. הלוחות והפתרונות שמורים כמחרוזות שטוחות לפי שורות, ולכל לוח יש פתרון יחיד. בנוסף, הלוחות באימון אינם שקולים מתמטית לאלו שבמבחן, והקושי נקבע לפי מספר החזרות לאחור שהפותחן של tdoku נדרש לבצע כדי לפתור אותם.

מתאים ל

  • מבחן הסקה למודלי שפה

    בדיקת היכולת של מודלים להתמודד עם בעיות אילוצים קשות ולספק פתרון מדויק ומלא.

  • אימון סולברים ייעודיים

    לימוד רשתות נוירונים לפתור לוחות קשים בלי להסתמך על אלגוריתמי חיפוש קלאסיים.

  • מדידת יכולת הכללה

    בחינה על לוחות במבחן שאינם שקולים מתמטית ללוחות שנראו בשלב האימון.

איפה זה נופל

הנתונים עוסקים אך ורק במספרים ובלוחות סודוקו, כך שאין כאן שום שפה טבעית או רלוונטיות לעברית. מקורות הלוחות הקשים מגיעים מארכיונים ופורומים ישנים, כולל קבצים מ־2010. מעבר לכך, הכרטיס לא מפרט אילו עמודות מדויקות קיימות בקבצים מלבד הלוח והפתרון, וההגדרה של קושי נשענת על אלגוריתם ספציפי מאוד של פותרן יחיד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. לא צוין שום רישיון במאגר, ולכן אין הרשאה חוקית לשימוש מסחרי. בנוסף, הנתונים נלקחו מפורומים ומאגרים שונים ברשת ללא הסדרת זכויות ברורה.

האם יש במאגר טקסט בעברית?

לא. המאגר מכיל רק לוחות סודוקו ופתרונות בייצוג של מספרים. אין בו שום טקסט, לא בעברית ולא בשפות אחרות.

איך נאספו הנתונים?

הנתונים לוקטו מקהילת חובבי הסודוקו. החידות הקלות הגיעו ממאגרים בקאגל, והקשות לוקטו משרשורים בפורום enjoysudoku וממבחני ביצועים של פותרן tdoku.

מה ההבדל בין קובץ האימון לקובץ המבחן?

קובץ האימון כולל 3.8 מיליון לוחות וקובץ המבחן כולל 423 אלף. היוצרים וידאו שהלוחות במבחן אינם שקולים מתמטית ללוחות שבאימון, כדי למנוע דליפת מידע בין הסטים.

איך טוענים

המאגר מחולק לשני קבצי CSV בלבד, train.csv שמכיל 3.8 מיליון דוגמאות ו־test.csv עם 423 אלף דוגמאות. אין צורך בבקשת גישה מיוחדת, טוענים ישירות דרך ספריית הדאטהסטים הרגילה או בקריאת קובץ פשוטה. הנתונים מיוצגים בצורה שטוחה, כך שצריך לפרוס את המחרוזות לגריד של תשע על תשע אם המודל שלכם מצפה למבנה מרחבי.

from datasets import load_dataset

ds = load_dataset("sapientinc/sudoku-extreme")

הרישיון

היוצרים לא דיווחו על רישיון כלל. מבחינה משפטית, כשאין רישיון מוגדר, אין לכם הרשאה ברורה להשתמש בנתונים, בטח שלא לשימוש מסחרי בחברה או במוצר. אימון מודל על בסיס המאגר הזה חושף אתכם לסיכון של הפרת זכויות יוצרים, במיוחד כשהתוכן נאסף מפורומים חיצוניים וממקורות שונים ברשת.

הרישיון המלא ב־Hugging Face ↗