GPT
3

34b-beta

קוד פתוח

CausalLMgpl-3.02024-02-06

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

מודל שפה של 34 מיליארד פרמטרים שמציע חלון הקשר ענקי של 200,000 טוקנים. הוא מיועד למי שרוצה לעבד כמויות עצומות של טקסט מקומית אבל מוכן להתמודד עם בעיות יציבות מוצהרות.

  • 34Bפרמטרים
  • 200,000טוקנים בהקשר
  • 64.1 GBמשקל הקבצים
  • 8,488הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Llama ומגיע בדיוק bfloat16, כשהייחוד המרכזי שלו הוא היכולת לקלוט עד 200,000 טוקנים בבקשה אחת. בבדיקת MT-Bench הוא רושם ציון של 8.5, מה שמציב אותו ברמה גבוהה של שיחה ומענה להוראות ביחס למודלים במשקל הזה. בנוסף, המפרסמים מציגים בדיקת זיהום נתונים במבחן MMLU עם ציון של 0.38, ומציינים שלמרות מגבלות עלות באימון, הוא לא אומן ישירות על המבחן.

הוא עובד עם מבנה הנחיות מסוג chatml, שמגדיר בצורה נקייה את התפקידים בשיחה בין המשתמש לעוזר. עם זאת, היוצרים עצמם מודים שיש בעיות בדיוק המשקולות בגרסת הבטא הזו, ושהם מתכננים לאמן חלקים מחדש בגרסאות הבאות כדי לתקן את זה. זה הופך אותו למעניין בעיקר לבדיקות עומק ולא בהכרח למערכות שחייבות יציבות מוחלטת כרגע.

מתאים ל

  • ניתוח מסמכים חריגים באורכם

    חלון הקשר של 200,000 טוקנים מאפשר להזין ספרים, דוחות ענק או תיקי קוד מלאים לתוך זיכרון הריצה.

  • בדיקות מקומיות בפורמט chatml

    ציון 8.5 ב־MT-Bench מראה יכולת ניהול שיחה גבוהה למי שמריץ Transformers באופן עצמאי.

  • עבודה מכוילת ב־llama.cpp

    המפתחים מציינים שכיול q8_0 נותן תוצאה יציבה ומהירה יותר מהרצה ישירה של המשקולות.

איפה זה נופל

הגרסה הזו סובלת מבעיות דיוק מובנות במשקולות, ברמה שהיוצרים הודיעו שיחזרו לאחור בחלק מההתקדמות ויאמנו שוב. אסור להשתמש בפרמטר repetition_penalty בריצה, ואסור לכייל קוונטיזציה באמצעות wikitext כי הטקסט שונה באימון. בנוסף, מנועי הסקה פופולריים כמו vllm פשוט לא מפיקים ממנו פלט ראוי כרגע.

שאלות
נפוצות

אפשר להריץ את המודל דרך vllm כדי לקבל תפוקה מהירה?

לא, הכרטיס מדגיש במפורש להימנע מסביבות הסקה מואצות כמו vllm כרגע. ישנן בעיות דיוק במשקולות שגורמות לנפילה חדה באיכות הטקסט תחת המנועים האלה. הפתרון הזמני הוא transformers או q8_0 ב־llama.cpp.

למה אסור להשתמש ב־wikitext כדי לכייל קוונטיזציה?

המפתחים יישרו את wikitext על גבי דאטה מלאכותי במהלך העבודה, ולכן ההתפלגות שלו שונה מהמקור. שימוש בו לצורך כיול יוביל לתוצאות מעוותות.

איך מריצים

המשקל המלא של הקבצים מגיע ל־64.1 גיגה בייט המחולקים ל־24 קבצים, כך שצריך זיכרון וידאו משמעותי מאוד כדי להחזיק אותו ב־bfloat16. היוצרים מציינים במפורש שאסור כרגע להריץ אותו דרך סביבות כמו vllm בגלל תקלות דיוק שמחרבות את איכות הפלט, וממליצים להשתמש בספריית transformers הרגילה.

אם אתם חייבים ביצועים מהירים יותר, ההמלצה בכרטיס היא לעבוד עם כיול q8_0 דרך llama.cpp, שלטענתם עובד טוב יותר מהרצה של המשקולות המקוריות ב־vllm. אם אין לכם את הברזלים המתאימים להחזיק עשרות גיגה בייטים בזיכרון, פנייה למודלים שמוגשים ב־API מסחרי תחסוך את כאב הראש התשתיתי.

from transformers import pipeline

pipe = pipeline("text-generation", model="CausalLM/34b-beta")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון gpl-3.0. מדובר ברישיון קוד פתוח מגביל שדורש ממי שמשלב ומפיץ את המודל לחשוף את קוד המקור של כל הפרויקט תחת אותו רישיון בדיוק. אם אתם בונים מוצר קנייני סגור, הרישיון הזה יוצר בעיה משפטית ישירה.

הרישיון המלא בעמוד המודל ↗