GPT
B

bagel-8b-v1.0

קוד פתוח

jondurbinother2024-04-24

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

התאמה אישית של Llama 3 8B שאומנה על עשרות מאגרי מידע מגוונים. הוא נבנה עבור מי שצריך מודל קומפקטי שמצטיין בעבודה קפדנית מול הקשר נתון וקריאות לפונקציות.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 8,386הורדות בחודש

מה זה

הבסיס כאן הוא Llama 3 8B, שעבר אימון הוראות מלא על אוסף הנתונים Bagel. בניגוד לגרסאות קודמות שהסתבכו עם כמה תבניות שונות, הפעם הכול מיושר לפי תבנית ה־instruct הרשמית של Llama 3. המטרה היתה ליצור מודל רב תכליתי שלא משתעמם בקלות, כזה שיודע להתמודד עם תכנות, פתרון בעיות מתמטיות ומשחקי תפקידים, לצד משימות תשתית כמו תמצות וחילוץ מידע.

במדד MT-Bench המודל מציג ציון ממוצע של 7.29, עם 7.64 בסיבוב הראשון ו־6.95 בסיבוב השני. המספרים האלה מציבים אותו מעל גרסאות 7B קודמות של הפרויקט, והמשמעות בפועל היא יכולת שיחה יציבה יותר ופחות נפילות במענה לשאלות המשך מורכבות.

מתאים ל

  • שליפת מידע RAG סגורה

    הוא אומן לענות אך ורק מתוך מסמכים נתונים עם תגיות BEGININPUT ו־ENDCONTEXT בלי לנחש.

  • קריאה לפונקציות וכלים

    כולל תמיכה מובנית בתבנית של GlaiveAI להמרת שאלות טבעיות לקריאות JSON מסודרות.

  • תכנון ריבוי שלבים reWOO

    מייצר תוכנית עבודה מפורטת שמחלקת פקודה מורכבת לרצף של כלי חיפוש ועיבוד.

איפה זה נופל

המודל הזה לא עבר יישור מבוסס DPO, מה שאומר שהוא עלול להיות פחות מלוטש בהעדפות מענה עדינות לעומת הגרסה הבאה שהובטחה. בנוסף, חלון ההקשר מוגבל ל־8,192 טוקנים. זה מספיק לשיחות ולמסמכים בינוניים, אבל יחנוק פרויקטים שדורשים ספרים שלמים או קוד מקור ענקי בבת אחת. משימות של תשובות מבוססות הקשר מחייבות אתכם להיצמד לתחביר קשיח עם תגיות ייעודיות, ואם לא תורידו את הטמפרטורה לרמה נמוכה מאוד הוא עדיין עלול לפספס ולהמציא עובדות.

אותה משפחה

bagel יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים להשתמש בתגיות המיוחדות לכל שאלה?

לא. שיחות רגילות, שאלות ידע כללי ותכנות עובדים מעולה עם תבנית השיחה הרגילה של Llama 3. התחביר המיוחד עם תגי הקלט מיועד רק למקרים שבהם מספקים לו מסמך חיצוני ורוצים לכפות עליו לענות אך ורק ממנו בלי להזות.

במה הוא שונה מגרסת ה־DPO שמוזכרת בפרויקט?

הגרסה הזו מכילה רק אימון הוראות ישיר (SFT). גרסת ה־DPO כוללת שלב כוונון נוסף שמדרג תשובות טובות מול רעות לשיפור יצירתיות, אמינות והסרת צנזורה, ולכן הגרסה הנוכחית מתאימה בעיקר כבסיס יציב או למשימות מוגדרות היטב.

איך מריצים

המשקל המלא בדיוק bfloat16 תופס 15.0 ג'יגה בייט של זיכרון. כדי להריץ אותו בלי עיוותים תצטרכו כרטיס מסך בודד עם לפחות 24 ג'יגה בייט זיכרון וידאו, כמו RTX 3090 או כרטיס שרת מקביל, או שתפנו לקוונטיזציה שתאפשר דחיסה לחומרה צנועה יותר. המודל נתמך ישירות בספריית transformers ומשתמש בטוקנייזר הרגיל של Llama 3 דרך פונקציית apply_chat_template.

אם אין לכם כרטיס מתאים מקומי, להרים שרת ייעודי בשביל 8B עלול להיות מיותר מבחינת עלויות. במצב כזה עדיף לצרוך מודלים בגודל דומה דרך נקודות קצה מוכנות ברשת, אלא אם הפרטיות של המידע מחייבת עבודה מקומית בלבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="jondurbin/bagel-8b-v1.0")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט מלא של תנאי ההפצה. כיוון שהוא מבוסס על Llama 3 של Meta, חלים עליו לכל הפחות תנאי השימוש וההגבלות המסחריות של מטא. אם אתם מתכננים להכניס אותו למוצר מסחרי, חובה לפנות למאגר המקור של Bagel ולוודא את תנאי הרישיון המדויקים לפני שמשחררים גרסה.

הרישיון המלא בעמוד המודל ↗