GPT
L

llama-30b-supercot

קוד פתוח

ausbossרישיון לא דווח2023-04-21

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

שילוב בין בסיס של שלושים מיליארד פרמטרים לבין אימון שמכוון להסקה צעד אחר צעד. מתאים למי שבונה שרשראות חשיבה מקומיות ולא רוצה להסתמך על ענן חיצוני.

  • 2,048טוקנים בהקשר
  • 60.6 GBמשקל הקבצים
  • 1,061הורדות בחודש
  • 126לייקים

מה זה

מדובר במיזוג של מודל LLaMA המקורי בגודל 30B עם שכבת LoRA בשם SuperCOT. המטרה המרכזית באימון הזה הייתה לחדד את יכולות החשיבה הלוגית בשיטת Chain of Thought, במיוחד עבור תרחישים שבהם מפעילים פרומפטים מורכבים בתוך סביבות כמו LangChain.

ההבדל העיקרי מול מודל הבסיס הרגיל הוא האופן שבו הוא מקבל הוראות ומפרק בעיות. הוא מצפה לפורמט בסגנון Alpaca עם שדות מוגדרים של הוראה וקלט, ומגיב טוב במיוחד להנחיות שמבקשות ממנו להסביר את ההיגיון שלו או לחשוב צעד אחר צעד לפני מתן תשובה סופית.

בכרטיס לא צורפו תוצאות של מבחני ביצועים או ציונים כמותיים. הדגש כאן הוא על התאמה מבנית לתהליכי עבודה קיימים בקוד פתוח ולא על שיאים חדשים בטבלאות ציונים.

מתאים ל

  • פירוק משימות בסיסי

    מתאים להרצת שרשראות חשיבה שמחייבות ניתוח הגיוני צעד אחר צעד ללא תלות ברשת חיצונית.

  • ניסויי LangChain מקומיים

    היוצר ייעד אותו לעבודה ישירה מול תבניות הפרומפטים והספריות של LangChain בסביבה מקומית.

  • מענה במבנה Alpaca

    עובד בצורה יציבה עם פניות המחולקות לשדות ברורים של הוראה וקלט עזר.

איפה זה נופל

הבעיה הבולטת ביותר היא חלון ההקשר המקורי שעומד על 2,048 טוקנים בלבד. במשימות חשיבה מורכבות שמפרקות בעיות לצעדים, ההקשר נגמר מהר מאוד, בטח כשמוסיפים לזה היסטוריה של שיחה או קטעי טקסט חיצוניים. בנוסף, הכרטיס מדגיש שהתגובות תלויות מאוד בניסוח מדויק של הפרומפט, ושינוי קל במבנה ההוראה עלול להניב פלט שונה לגמרי. אין כאן מנגנון בטיחות מובנה או התאמה מיוחדת לעברית.

שאלות
נפוצות

האם המודל תומך בשפה העברית בצורה טובה?

המודל מתבסס על ארכיטקטורת LLaMA המקורית ולא עבר אימון ייעודי בעברית. היכולות שלו בשפות שאינן אנגלית נמוכות מאוד והוא לא מיועד למשימות ניתוח או יצירת תוכן בעברית.

איזה מבנה פרומפט חובה לספק לו כדי לקבל תוצאה טובה?

יש להקפיד על מבנה עם תגיות של Instruction, Input ו־Response, בדומה להנחיות של Alpaca. מומלץ להוסיף להוראה בקשה מפורשת לחשוב בצורה הגיונית או להסביר את הצעדים כדי לנצל את האימון שלו.

איך מריצים

כדי להריץ אותו בדיוק המקורי של float16 תצטרכו להחזיק בזיכרון מעל שישים גיגה בייט של משקלים, מה שדורש לפחות שני כרטיסי מסך חזקים. היוצר מפנה למחברת שמבוססת על המודולים של Oobabooga ומציין שהמשקלים נבנו כך שיתאימו גם להמרות קוונטיזציה של 4 ביט.

אם אין לכם תחנת עבודה ייעודית עם כרטיסי מסך מתאימים, הניסיון לטעון מעל שישים גיגה בייט בקוד פייתון רגיל על מעבד פשוט יזחל. במצב כזה עדיף לפנות לפתרונות מרוחקים במקום לתחזק שרת כזה בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="ausboss/llama-30b-supercot")
print(pipe("שלום"))

הקבצים

253 קבצים במאגר, 60.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון כלל. מעבר לזה, הוא מבוסס על משקלי LLaMA הראשונים של מטא, ששוחררו במקור לשימוש מחקרי בלבד. בלי רישיון ברור ובגלל מקור המשקלים, מסוכן לשלב אותו במוצר מסחרי או להפיץ אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗