GPT
J

jat

קוד פתוח

jat-projectרישיון לא דווח2024-01-16

  • transformers
  • safetensors
  • jat
  • text-generation
  • reinforcement-learning

זהו מודל למידת חיזוק קטן המבוסס על ארכיטקטורת שנאי, שמסוגל לפעול במספר סביבות שונות כמו משחקי אטארי וסימולציות רובוטיות.

  • 193Mפרמטרים
  • 512טוקנים בהקשר
  • 842 MBמשקל הקבצים
  • 2,083הורדות בחודש

מה זה

מדובר במודל של 193 מיליון פרמטרים שנועד לפעול כסוכן רב-משימתי על פני סביבות מגוונות, כולל BabyAI, MetaWorld, MuJoCo ומשחקי Atari 57. הרעיון כאן הוא לקחת ארכיטקטורת רשת יחידה, JatModel, ולהחיל אותה על קבלת החלטות ברצף במקום לאמן מודל נפרד לכל משחק או זרוע רובוטית.

התוצאות בשטח מראות הבדלים עצומים בין המשימות. בסביבות מובנות ופשוטות יחסית כמו BabyAI הוא מציג ציון מנורמל מול מומחה של 0.99, ובסימולציות פיזיקליות של MuJoCo הוא מגיע ל־0.85. לעומת זאת, באטארי הביצועים צונחים לממוצע IQM של 0.14 בלבד מול מומחה ו־0.38 מול שחקן אנושי, למרות שבכותרים ספציפיים כמו Krull או Boxing הוא מצליח לעקוף בני אדם בקלות.

מתאים ל

  • ניווט בעולמות רשת בסיסיים

    מתאים לפתרון משימות ב־BabyAI, שם המודל מציג ביצועים כמעט מושלמים ביחס למומחה.

  • סימולציות תנועה ב־MuJoCo

    מציג רמת שליטה גבוהה של 0.85 במדד מומחה, ומתאים לניסויי בקרה רציפה.

  • מחקר על סוכנים כלליים

    בסיס נוח לבדיקת יכולות הכללה של שנאים בקבלת החלטות, בזכות גודל קל ורב-גוניות.

איפה זה נופל

החולשה העיקרית היא חוסר עקביות קיצוני בין סביבות שונות. במשחקים שדורשים תכנון ארוך או תנועה מורכבת כמו Montezuma's Revenge, Asteroids או Kung-Fu Master המודל מקבל ציון 0 עגול. בנוסף, ב־Solaris נרשם ציון שלילי מול מומחה. אם המטרה שלכם היא ביצועים אמינים בעולם האמיתי או במשחקים מורכבים, אי אפשר לסמוך עליו ללא בדיקה מדויקת של הסביבה הספציפית.

שאלות
נפוצות

האם המודל מתאים לשימוש מסחרי?

כרגע לא, כיוון שלא פורסם רישיון שימוש בכרטיס המודל. כל עוד המפתחים לא הגדירו רישיון פתוח, אסור להפיץ אותו בתוך מוצר מסחרי.

האם הוא יכול לשחק בכל משחק אטארי ברמה טובה?

ממש לא. הביצועים נעים בין תוצאות גבוהות במשחקים כמו Boxing ו־Krull לבין כישלון מוחלט וציון אפס במשחקים כמו Montezuma's Revenge.

איזה חומרה צריך כדי להריץ את המודל?

המודל שוקל 842 מגה-בייט בלבד עם 193 מיליון פרמטרים, כך שניתן להריץ אותו בקלות על מעבד מחשב רגיל או כרטיס מסך ביתי פשוט.

איך מריצים

המשקל הכולל של הקבצים עומד על 842 מגה-בייט בלבד בדיוק של float32, כך שלא צריך שרת ייעודי כדי להרים אותו. כל כרטיס מסך בסיסי עם 2 עד 4 גיגה זיכרון יריץ אותו בלי בעיה, ואפשר להפעיל אותו אפילו על מעבד רגיל של מחשב נייד ישירות דרך ספריית transformers.

אין כאן שירות ענן או API מסחרי מוכן שמשלמים עליו לפי קריאה, כך שהרצה עצמית היא האפשרות היחידה. ההתקנה פשוטה מאוד בזכות המשקל הנמוך והתאימות לספרייה, אך יש לקחת בחשבון חלון הקשר קצר של 512 טוקנים שמגביל את כמות ההיסטוריה שהסוכן זוכר בכל צעד.

from transformers import pipeline

pipe = pipeline("reinforcement-learning", model="jat-project/jat")
print(pipe("שלום"))

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. המשמעות בפועל עבור מפתחים היא שאין אישור מפורש לשימוש מסחרי, הפצה או שילוב בקוד של מוצר, ומבחינה משפטית מדובר בסיכון עד שהיוצרים יבהירו את התנאים.

הרישיון המלא בעמוד המודל ↗