GPT
M

model-evaluator

רץ בדפדפן

autoevaluateרישיון לא דווח2022-04-11

  • streamlit

ממשק לשליחת משימות הערכה של מודלים ישירות למערכת של AutoTrain. מיועד למפתחים שרוצים לבדוק ביצועים של מודלים על מאגרי נתונים קיימים.

  • הורדות בחודש
  • 174לייקים

מה זה

בממשק בוחרים מודלים ומאגר נתונים מתוך Hugging Face, ומגדירים את המשימה להרצה. הוא מטפל במשימות טקסט ותמונה כמו סיווג בינארי, סיווג מרובה מחלקות, תרגום, סיכום וחילוץ ישויות, לצד בדיקות על נתונים כמו rajpurkar/squad. הממשק דורש התאמת שמות עמודות של הקלט והתוויות למבנה אחיד לפני ההרצה.

מאחורי הקלעים הכלי לא מריץ את החישובים בעצמו. הוא מתחבר ל־API של AutoTrain, יוצר שם פרויקט הערכה עם המודלים שנבחרו, ומעבד את מאגר הנתונים לקראת הבדיקה. כל הנתונים על סטטוס הריצות נשמרים במאגר ייעודי של לוגים בשם autoevaluate/evaluation-job-logs, שדרכו המערכת עוקבת אחרי התקדמות התהליך.

מתאים ל

  • הערכת מודלי תרגום וסיכום

    שליחת מודלים קיימים להרצת מדדי איכות מול מאגרי טקסט מוכנים ב־AutoTrain.

  • בדיקת סיווג תמונות

    בחינת דיוק של מודלי סיווג תמונה בינאריים או מרובי מחלקות מול נתוני בדיקה.

  • חילוץ ישויות ומענה לשאלות

    הרצת בדיקות אוטומטיות למודלי שפה על מאגרים תואמים כמו squad.

איפה זה נופל

הפרויקט הוגדר כארכיון ישן ואינו נתמך יותר, ובדפדפן מופיעה שגיאת ריצה שמונעת עבודה רגילה. בנוסף, אין תמיכה בסיווג רב־תוויות (multi-label), ומי שמחפש הערכה של מודלי שפה גדולים מודרניים ימצא שהכלי לא מתאים ומופנה ללוחות מובילים חיצוניים. הממשק רק פותח את הפרויקט, כך שתוצאות מיידיות לא מופיעות על המסך.

שאלות
נפוצות

האם הכלי עובד עכשיו בדפדפן?

לא, המערכת מדווחת על תקלת ריצה והפרויקט עצמו הועבר לארכיון. כדי להשתמש בו צריך להוריד את הקוד, להגדיר משתני סביבה מתאימים ולהריץ אותו באופן עצמאי.

האם אפשר להריץ את המערכת על המחשב?

כן, הקוד כולל קובץ דרישות וסקריפט Streamlit שניתן להפעיל מקומית. לשם כך יש צורך בהגדרת טוקן מתאים של בוט ההערכה והפניה לכתובת ה־API הנכונה.

כמה זמן לוקח לקבל תוצאות?

התוצאות אינן מיידיות כלל. שליחת הבקשה רק רושמת את הפרויקט, וסקריפט בדיקה רץ באופן אוטומטי אחת לרבע שעה כדי להתחיל את העבודה בשרתי AutoTrain.

במה הכלי שונה מהרצת המודלים עצמם?

הוא לא מבצע את החישוב בפועל אלא משמש רק כממשק הזנה. הוא מארגן את הנתונים ושולח פקודות למערכות חיצוניות שמחשבות את ציוני המודלים.

איך משתמשים

בוחרים מודלים ומאגר נתונים ולוחצים על כפתור השליחה. הבדיקה לא מתחילה באותו רגע, אלא נכנסת לתור שרץ פעם ב־15 דקות דרך GitHub Actions שמפעיל את הסקריפט הייעודי. הממשק עצמו יושב על מעבד בסיסי, והוא נמצא כרגע במצב של תקלת ריצה, כך שאי אפשר להשתמש בו ישירות בדפדפן בלי לפתור את השגיאה או להריץ את הקוד מקומית עם מפתח API מתאים.

הרישיון

הפרויקט לא מציג רישיון שימוש בקבצים שלו. המשמעות היא שאין הרשאה ברורה להעתיק או לעשות שימוש מסחרי בקוד, ומאגרי הנתונים והמודלים שמוזנים אליו כפופים לרישיונות המקוריים שלהם ב־Hugging Face.

הרישיון המלא ב־Hugging Face ↗