GPT
U

UserLM-8b

קוד פתוח

microsoftmit2025-09-30

  • safetensors
  • llama
  • userlm
  • simulation
  • text-generation

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

במקום לענות כמו עוזר, הוא אומן להתנהג כמו המשתמש ששואל את השאלות. הוא מייצר שיחות ריאליסטיות כדי לבדוק איך צ'אטבוטים אחרים מתמודדים עם בני אדם.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 29.9 GBמשקל הקבצים
  • 2,923הורדות בחודש

מה זה

מיקרוסופט לקחו את Llama3-8b-Base ואימנו אותו במטרה הפוכה מהרגיל. הוא קיבל אימון מלא על בסיס נתוני שיחות ממאגר WildChat כדי לחזות את התור הבא של המשתמש האנושי, במקום לנסח תשובות מנומסות של סייען דיגיטלי. נותנים לו כוונת משתמש כללית, והוא מייצר את הפנייה הראשונה, ממשיך לשאול שאלות לאורך השיחה, ויודע מתי לפלוט טוקן סיום כשהעסק מוצה.

במבחני הערכה מול מודלים רגילים שקיבלו הנחיה להתנהג כמו משתמש, הוא מציג מדד פרפלקסיטי נמוך יותר על שיחות שלא נראו באימון, ומנצח אותם בשישה מדדים שונים של התנהגות משתמש. במבחנים של כתיבת קוד ופתרון בעיות מתמטיות, הסימולציות שלו הציגו קצב שיחה מגוון ובחירת מילים טבעית יותר, מה שהקשה על סייענים מולו וחשף כשלים שפרומפטים רגילים לא הצליחו לגלות.

מתאים ל

  • בדיקת איכות לסייענים

    סימולציה של משתמשים אמיתיים לצורך הרצת שיחות אוטומטיות מרובות תורות ובדיקת עמידות של צ'אטבוטים.

  • ייצור דאטה סינתטי

    הפקת דיאלוגים מגוונים בשילוב עם מודל סייען כדי ליצור נתוני אימון מורכבים יותר.

  • בסיס למודלי שפיטה

    אימון מודלים להערכת טיב השיחה מנקודת מבטו של המשתמש ולא מנקודת המבט של המערכת.

איפה זה נופל

הוא לא מודל שירות, ואם תנסו לבקש ממנו עזרה במשימה הוא פשוט ימשיך לדבר כמו מישהו שמבקש עזרה בעצמו. החוקרים מציינים שהוא לא מגיע למאה אחוזי יציבות, ולפעמים שוכח את התפקיד שלו או סוטה מהכוונה המקורית שהוגדרה לו. בעיה בולטת נוספת היא הזיות של דרישות ומגבלות שלא הופיעו בהנחיה המקורית, מה שעלול להרוס בדיקות אוטומטיות. הוא אומן ונבדק באנגלית בלבד, לא עבר חיסון נגד התקפות הזרקת פרומפט, וכדי להוציא ממנו תוצאות טובות צריך לממש מנגנוני סינון ייעודיים על הפלטים.

שאלות
נפוצות

האם אפשר להשתמש בו כעוזר אישי או בוט תמיכה?

לא. המודל אומן בצורה הפוכה כדי לדמות את הצד שפונה לעזרה ולא את הצד שעונה. הוא מתאים למעבדות בדיקה ולהרצת תרחישים, לא לשיחה ישירה עם לקוחות שמחפשים פתרון לבעיה.

איך הוא מסתדר עם שיחות בעברית?

הוא פותח ונבדק על נתונים באנגלית בלבד. אם תזינו לו טקסט בעברית, הביצועים שלו לא מובטחים וסביר להניח שהוא יאבד את התפקיד או יפיק פלטים משובשים.

מה צריך להגדיר לו כדי לקבל סימולציה טובה?

מזינים לו משפט שמגדיר את כוונת המשתמש, ובנוסף מומלץ ליישם חסימות על חזרות מילים, הגבלת אורך מקסימלי ומניעת סיום מוקדם מדי של השיחה.

איך מריצים

המשקל המקורי מגיע בפורמט float32 ותופס כמעט שלושים גיגה בייט בזיכרון, כך שאי אפשר להריץ אותו בצורתו הגולמית על כרטיס ביתי פשוט. תצטרכו לפחות מעבד גרפי מקצועי עם 32 או 48 גיגה בייט זיכרון כדי לטעון אותו, או להמיר אותו לקוונטיזציה נמוכה יותר של 4 או 8 ביט כדי לדחוס אותו לכרטיס צרכני רגיל.

האימון עצמו בוצע עם אורך הקשר של 2,048 טוקנים בלבד, למרות שהארכיטקטורה תומכת בעד 8,192, ולכן שיחות ארוכות במיוחד עלולות לגרום לו לאבד את הכיוון. מי שרק רוצה לבחון איכות של סייען בלי להחזיק תשתית כבדה יכול להסתפק בפרומפט פשוט למודל גדול דרך ספק ענן, אבל כדי לקבל הדמיית משתמש אמינה ועקבית צריך להריץ את המשקלים האלה מקומית.

pip install -U huggingface_hub
hf download microsoft/UserLM-8b

הרישיון

רישיון MIT חופשי ומתיר שימוש מסחרי, שינוי קוד והפצה בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית. עם זאת, החוקרים עצמם ממליצים במפורש להגביל את השימוש למחקר בלבד ולא לשלב אותו במערכות ייצור בעולם האמיתי בלי בדיקות נוספות והתאמות בטיחות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗