GPT
D

DialoGPT-large

קוד פתוח

microsoftmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • gpt2

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שיחה ותיק שמיועד לייצר תגובות בצ'אט מרובה תורות, ואומן על דיונים ציבוריים משרשורי רדיט. הוא מתאים למי שמחפש בוט שיחה קל יחסית שרץ מקומית בלי סיבוכים.

  • 1,024טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 2,447הורדות בחודש
  • 289לייקים

מה זה

המודל הזה נבנה על בסיס ארכיטקטורת GPT-2 ומטרתו לייצר תשובות דיאלוגיות שנשמעות טבעיות. האימון שלו התבסס על מאגר עצום של 147 מיליון דיאלוגים מרובי תורות מתוך רדיט, מה שנותן לו סגנון דיבור חופשי, קולח ופחות יבש ממודלים שנועדו רק להשלמת מסמכים.

לפי בדיקות הערכה אנושית שמפתחיו הציגו, איכות התשובות שלו בשיחה של תור בודד התקרבה לרמה של תשובות אנושיות במבחני טיורינג. בשונה ממודלים גנריים של טקסט מאותה תקופה, הדגש כאן הוא על קוהרנטיות בין שאלות ותשובות ברצף השיחה, ולא על כתיבת מאמרים או סיכומי תוכן.

מתאים ל

  • בוט חברתי לשיחות חולין

    הוא למד משיחות רדיט ויודע לנהל סמול טוק קליל וזורם בלי להישמע כמו תסריט קבוע.

  • דמויות למשחקי מחשב

    משתלב טוב כדמות ללא שחקן שיכולה לענות באופן חופשי ומעט שנון על שאלות השחקן.

  • ניסויי מחקר בדיאלוג מקומי

    מודל זמין ומוכר להרצה מקומית מלאה כשרוצים לבדוק תגובות שיחה בלי תלות ברשת.

איפה זה נופל

חלון ההקשר עומד על 1,024 טוקנים בלבד. בשיחה אמיתית עם היסטוריה של כמה תורות, אתם תגיעו לתקרה הזו מהר מאוד, והמודל יתחיל לשכוח מה נאמר קודם.

בנוסף, הוא אומן על שרשורי רדיט. זה אומר שהוא מועד לתשובות עוקצניות, סרקסטיות או פשוט לא מתאימות אם אתם מחפשים בוט שירות לקוחות רציני ומנומס. אין כאן מנגנוני בטיחות מודרניים, ולכן חובה לסנן את הקלטים והפלטים לפני שחושפים אותו לאנשים.

שאלות
נפוצות

האם הוא מתאים לשימוש כנציג שירות לקוחות?

לא מומלץ. בגלל שהאימון נעשה על רדיט, התשובות שלו עשויות להיות ציניות, אירוניות או לא מבוססות עובדתית. הוא מיועד לשיחה פתוחה ולא למתן מידע מדויק או מבוקר.

האם המודל תומך בשיחות בעברית?

הכרטיס מציג אימון באנגלית בלבד מתוך רדיט. הוא לא אומן על עברית, ואם תנסו להריץ מולו קלט בעברית התוצאות יהיו שבורות, לא מדויקות או פשוט ג'יבריש.

איך מריצים

כדי להריץ אותו משתמשים בספריית transformers עם המחלקה הייעודית של GPT-2. המשקל הכולל של הקבצים עומד על 7.4 גיגה בייט, כך שמבחינת חומרה אתם תצטרכו כרטיס מסך עם זיכרון סביר, סביב 8 עד 12 גיגה בייט של VRAM, כדי לייצר תשובות בלי להיחנק.

אם אין לכם GPU זמין בשרת או במחשב הפיתוח, ההרצה על מעבד רגיל תהיה אטית להחריד ולא תתאים לצ'אט בזמן אמת. במצב כזה, או אם אין לכם עניין לנהל תשתית שרתים משלכם בשביל מודל ששוקל כמה גיגות, עדיף להשתמש בפתרון מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/DialoGPT-large")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד המתירניים ביותר שיש. אפשר להשתמש בו לפרויקטים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗