GPT
L

longchat-13b-16k

קוד פתוח

lmsysרישיון לא דווח2023-06-28

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסה מורחבת של LLaMA המיועדת לשיחות ארוכות במיוחד. מתאים למי שחייב לעבד טקסטים ארוכים מקומית ומוכן להתעסק עם טלאי תוכנה ידניים.

  • 2,048טוקנים בהקשר
  • 24.2 GBמשקל הקבצים
  • 2,586הורדות בחודש
  • 134לייקים

מה זה

מדובר במודל שיחה שמבוסס על llama-13b ועבר אימון נוסף על כ־18 אלף שיחות משתמשים שנאספו מ־ShareGPT. כדי להתמודד עם טקסטים ארוכים בהרבה מהמקור, החוקרים השתמשו בטכניקה של condensing rotary embedding. המטרה העיקרית שלו היא לאפשר עיבוד והבנה של שיחות והקשרים נרחבים בלי לאבד את חוט המחשבה.

השם שלו כולל 16k, והוא מכוון ישירות לחוקרים שמחפשים מענה למשימות של הקשר ארוך. הוא שונה מגרסאות 13B רגילות מהתקופה הזו, שקרסו כמעט מיד כשהעמיסו עליהן יותר מכמה אלפי טוקנים. ההערכה שלו נעשתה באמצעות מבחן בשם LongEval שהמפתחים שחררו, כך שכל המיקוד כאן הוא ביצועים תחת עומס של מלל רב ולאו דווקא יכולות שיחה כלליות ליומיום.

מתאים ל

  • מחקר על הקשר ארוך

    הוא מיועד מראש לבדיקת התנהגות מודלים בשיחות ארוכות ומלווה במבחן LongEval.

  • ניתוח שיחות עבר מרובות

    האימון על 18 אלף שיחות מ־ShareGPT עוזר לו לעקוב אחרי רצף דיאלוגי מפותל.

  • בדיקות מעבדה פנימיות

    מתאים לסביבה מבודדת שבה אפשר להריץ FastChat עם הטלאי הנדרש בלי תלות בענן.

איפה זה נופל

המודל נועד במקור למחקר ולא למוצרי קצה. הוא אומן על שיחות ShareGPT, כך שהוא סוחב איתו את כל ההטיות, השגיאות והתשובות החלקיות שהמשתמשים הזינו שם. בנוסף, העובדה שצריך טלאי תוכנה ידני רק כדי לטעון אותו הופכת כל שילוב שלו בצינור פיתוח מודרני לכאב ראש אמיתי שדורש בדיקה מעמיקה.

אותה משפחה

longchat יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לטעון אותו רגיל דרך הספרייה הרגילה?

לא באופן ישיר. המפתחים מציינים במפורש שחייבים להשתמש בקוד מתוך FastChat או LongChat שמכיל טלאי ייעודי לעיבוד המיקומים.

איזה כרטיס מסך צריך כדי לבדוק אותו?

המשקל שלו הוא 24.2 ג'יגה בייט, ולכן דרוש כרטיס עם 24 ג'יגה זיכרון לפחות, במיוחד כשרוצים לנצל את מלוא אורך השיחה.

איך מריצים

אי אפשר לטעון אותו ישירות מתוך transformers בצורה נקייה. המפתחים מבהירים שצריך monkey patch מיוחד, ומפנים לשימוש בקוד של FastChat או LongChat כדי להפעיל אותו דרך שורת הפקודה או ממשק מקומי.

הקבצים שוקלים 24.2 ג'יגה בייט בפורמט float16. כדי להריץ מודל בגודל 13B כזה, תצטרכו כרטיס מסך עם לפחות 24 ג'יגה בייט זיכרון וידאו, ורצוי יותר אם אתם באמת מתכוונים לנצל הקשרים ארוכים. אם אין לכם חומרה כזו פנויה, להרים שרת ייעודי רק בשבילו יעלה לא מעט, ולפעמים זול ופשוט יותר לשלוח קריאות לשירות ענן חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="lmsys/longchat-13b-16k")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור שימוש ברור, לא לצרכים מסחריים ולא להפצה. אם אתם בונים מוצר לחברה, עדיף להתרחק עד שהיוצרים יבהירו תחת איזה רישיון הקבצים משוחררים.

הרישיון המלא בעמוד המודל ↗