GPT
G

Guanaco

קוד פתוח

JosephusCheunggpl-3.02023-04-08

  • transformers
  • pytorch
  • llama
  • text-generation
  • guannaco

התאמה של מודל LLaMA 7B למעקב אחר הוראות ומשחקי תפקידים בארבע שפות. מתאים למי שמחפש בוט שיחה רב לשוני על בסיס נתונים מורחב של חצי מיליון דוגמאות.

  • 2,048טוקנים בהקשר
  • 25.1 GBמשקל הקבצים
  • 73הורדות בחודש
  • 230לייקים

מה זה

המודל מתבסס על LLaMA 7B של מטא, אך מרחיב את בסיס הנתונים המקורי של Alpaca מ־52 אלף רשומות ליותר מ־534 אלף. המטרה של ההרחבה הזו היא לאפשר עבודה מיושרת במספר שפות, כולל אנגלית, סינית מפושטת ומסורתית, יפנית וגרמנית, לצד משימות דקדוקיות שונות. מבנה הפרומפט שונה מהפורמט של אלפקה ומשתמש בחלוקה לתפקידים של מערכת, משתמש ועוזר כדי לנהל שיחות מרובות תורות.

בנוסף לשיחה רגילה, הוא אומן לתמוך במשחקי תפקידים בדומה לסגנון של Character AI, כולל שמירה על פורמט קבוע של שם הדמות והתשובה שלה. המפתחים הטמיעו גם מילות מפתח מיוחדות לפרומפט המערכת, כמו הוראות לדחיית מענה כשחסר ידע או לסירוב מטעמי בטיחות ותוכן לא הולם. אין בכרטיס המודל מדדי ביצועים מספריים או מבחני השוואה סטנדרטיים, כך שקשה לאמוד את הדיוק היחסי שלו מול גרסאות מתחרות.

מתאים ל

  • משחקי תפקידים וצ'אטבוטים

    הוא אומן להגיב בשם דמויות ולשמור על אופי עקבי באנגלית, סינית, יפנית וגרמנית.

  • מחקר על מודלים רב לשוניים

    התאמת משקלים פתוחה על גבי בסיס נתונים רחב שמאפשרת לבחון יכולות שפה מעבר לאנגלית.

  • עיבוד הוראות מקומי

    הרצה מקומית ללא תלות ברשת של משימות טקסט קצרות לפי הנחיות מובנות.

איפה זה נופל

המודל סובל מהזיות וטעויות בידע כללי, והיוצרים עצמם מזהירים שכל מידע עובדתי שהוא מייצר עלול להיות שגוי לחלוטין. כדי להתמודד עם זה, הם דורשים להזין מקורות מאומתים כמו ויקיפדיה ישירות לתוך פרומפט המערכת. בנוסף, המידע שעליו הוא אומן לא עבר סינון של תוכן פוגעני, מוטה או בוטה, מה שאומר שהוא עלול לפלוט תשובות בעייתיות ללא בקרה חיצונית. עברית אינה נכללת ברשימת השפות הנתמכות, וחלון ההקשר מוגבל ל־2,048 טוקנים בלבד, מגבלה שמקשה על ניהול שיחות ארוכות.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין תמיכה באנגלית, גרמנית, יפנית ושני סוגי כתב סיני בלבד. עברית לא נכללה בנתוני האימון, ולכן המודל אינו מתאים ליישומים בעברית.

האם זה אותו מודל מפרויקט QLoRA המפורסם?

לא. מדובר בפרויקט נפרד שהשתמש באותו השם והתפרסם באפריל 2023. יוצרי המודל הזה אף ביקרו בחריפות את השימוש בשם Guanaco על ידי מחברי מאמר ה־QLoRA.

האם כדאי לכווץ אותו ל־8 ביט כדי לחסוך זיכרון?

המפתחים מציינים במפורש שכיול ל־8 ביט פוגע בביצועים בצורה מורגשת וממליצים להישאר ב־fp16. אם יש מחסור בזיכרון גרפי, הם מפנים לגרסה מכווצת ייעודית שדורשת כ־5 גיגה בייט זיכרון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־25.1 גיגה בייט בפורמט float16, ומחולק ל־17 קבצים. המפתחים ממליצים להריץ אותו ב־fp16 ומזהירים שדיוק של 8 ביט פוגע בביצועים בצורה משמעותית. למי שמחזיק כרטיס מסך ביתי צנוע יש גרסה מכווצת נפרדת שדורשת מעל 5 גיגה בייט של זיכרון גרפי, ואפשר גם להריץ את המודל המקורי על גבי מעבד T4 ב־Google Colab החינמי.

הקריאה למודל מתבצעת דרך ספריית transformers העדכנית, ויש להקפיד על מבנה הפרומפטים הספציפי שמוגדר במאגר guanaco-lora בגיטהאב כדי לקבל תוצאות עקביות. אם המטרה היא להרים שירות יציב ללא התעסקות עם חומרה וזמני טעינה כבדים, עדיף להשתמש ב־API מנוהל של מודלים מודרניים יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="JosephusCheung/Guanaco")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון GPL 3.0. זהו רישיון קוד פתוח עם תנאי הדבקה, שמחייב אתכם לשחרר את כל קוד המקור של המוצר שלכם תחת אותו הרישיון אם אתם מפיצים אותו. בנוסף, המודל מתבסס ישירות על הדור הראשון של LLaMA מבית מטא, מה שמטיל מגבלות שימוש נוספות מעבר ל־GPL. שילוב של המודל במוצר מסחרי סגור בעייתי מאוד מבחינה משפטית.

הרישיון המלא בעמוד המודל ↗