GPT
D

DMind_Benchmark

קוד פתוח

DMindAIרישיון לא דווח2025-04-22

חבילת מבחנים לבדיקת מודלי שפה על ידע בעולמות הבלוקצ'יין, חוזים חכמים וקריפטו. היא כוללת קוד הרצה מלא לצד שאלות רב ברירה ושאלות פתוחות.

  • 480הורדות בחודש
  • 82לייקים

מה זה

המאגר מחולק לשני סוגי מבחנים עיקריים שיושבים תחת תיקיית נתוני הבדיקה. החלק הראשון מכיל שאלות אובייקטיביות של בחירה מרובה, עם תשובה נכונה יחידה או כמה תשובות נכונות, שמנוקדות ישירות מול התשובה הרצויה. החלק השני מורכב משאלות פתוחות וסובייקטיביות שדורשות נימוקים מעמיקים, ניתוחי סיכונים, איתור פגיעויות אבטחה וחישובים מורכבים.

התוכן עצמו פרוס על פני תשעה תחומים שונים, ובהם יסודות הבלוקצ'יין, פיננסים מבוזרים, ביקורת קוד של חוזים חכמים, ארגונים אוטונומיים, טוקנומיקה ותשתיות רשת. הקבצים שמכילים את השאלות מגיעים בפורמטים של קובצי טבלאות וג'ייסון. דפי התיעוד והקוד לא חושפים מהיכן בדיוק נאסף המידע הגולמי או אילו תהליכי סינון ידניים ואוטומטיים הופעלו על השאלות כדי לוודא את נכונותן המקצועית לפני הפרסום.

מתאים ל

  • הערכת מודלים בתחום הקריפטו

    בדיקת יכולות הבנה וניתוח של מודלי שפה על חוזים חכמים ובלוקצ'יין לפני שילובם במערכת.

  • ביקורת שגיאות קוד

    בחינת הדיוק של מודל בזיהוי חולשות אבטחה וסיווג פגיעויות בחוזים חכמים מבוזרים.

  • בנצ'מרק השוואתי

    הרצת בדיקות אחידות על מספר ספקי בינה מלאכותית שונים לשם השוואת ביצועים ועלויות.

איפה זה נופל

הכרטיס לא מציין אף מילה על מקור הנתונים, מי ניסח את השאלות, או תאריכי תפוגה של המידע. בעולם של בלוקצ'יין ופרוטוקולים שמשתנים במהירות, שאלות על שווקים או רגולציה מתיישנות תוך חודשים ספורים. הבדיקות נשענות לחלוטין על אנגלית, ואין כאן שום ייצוג למונחים או שווקים מקומיים. מעבר לזה, הבדיקה הסובייקטיבית נשענת על מודל צד שלישי שמעריך תשובות לפי התאמת מילות מפתח, שיטה שמכניסה הטיות מובנות בהתאם למודל השופט שנבחר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ כרגע. היוצרים לא צירפו רישיון שימוש למאגר, ובמצב כזה כל הזכויות שמורות להם מבחינה חוקית. שימוש מסחרי, אימון או הפצה מחדש דורשים קבלת אישור מפורש מהמפרסמים.

האם יש במאגר שאלות בעברית?

לא. כל השאלות, התשובות והקוד כתובים באנגלית בלבד. אם המערכת שלכם מיועדת לעבוד בעברית, תצטרכו לתרגם את השאלות בעצמכם או לבנות סט בדיקה נפרד.

איך בנוי תהליך הניקוד של המבחן?

שאלות סגורות מקבלות שתי נקודות לבחירה יחידה ושלוש נקודות לבחירה מרובה. שאלות פתוחות מוערכות באמצעות מודל שפה חיצוני לפי מילות מפתח ומבנה תשובה.

האם אפשר להשתמש בזה רק כדאטהסט רגיל דרך האתר?

פחות מתאים. המאגר מתוכנן לעבודה כפרויקט תוכנה שכולל קובצי פייתון, פקודות אוטומציה והגדרות חיבור לשרתי בינה מלאכותית, ולא כקובץ נתונים פסיבי בלבד.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. העבודה לא נעשית דרך ספריית הנתונים הרגילה אלא כפרויקט קוד מלא, שמריצים אותו בעזרת פקודות מייק או סקריפטים ישירים של פייתון. לפני ההרצה חייבים להגדיר קובץ הגדרות עם מפתחות גישה לשירותי מודלים כמו אנתרופיק, אופן איי איי או גוגל. המערכת עובדת עם ריבוי תהליכים ומריצה עד חמישים קריאות במקביל, מה שעלול לחרוג מהר מאוד ממגבלות הקצב של ספקי המודלים אם לא מנמיכים את המספר מראש.

from datasets import load_dataset

ds = load_dataset("DMindAI/DMind_Benchmark")

הרישיון

היוצרים לא הגדירו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות להם ואסור להעתיק, להפיץ או להשתמש בתוכן באופן מסחרי בלי אישור מפורש. מפתחים שרוצים לאמן מודלים על בסיס השאלות האלה או להטמיע אותן במוצר מסחרי מסתכנים בהפרת זכויות יוצרים, ולכן המאגר מתאים בשלב זה למחקר פנימי בלבד.

הרישיון המלא ב־Hugging Face ↗