GPT
L

Llama-3-8B-Instruct-Gradient-1048k

קוד פתוח

gradientaillama32024-04-29

  • transformers
  • safetensors
  • llama
  • text-generation
  • meta

גרסה מורחבת של Llama 3 שמסוגלת לקרוא מעל מיליון טוקנים בהרצה מקומית. הפתרון מיועד למי שרוצה לעבד מסמכי ענק על חומרה נגישה בלי לשלוח מידע לשרתי ענן חיצוניים.

  • 8Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 36,311הורדות בחודש

מה זה

המודל הזה לוקח את Llama 3 8B Instruct המקורי, שהגיע עם חלון קצר של שמונת אלפים טוקנים, ומותח אותו ליותר ממיליון טוקנים. הצוות של Gradient עשה את זה באמצעות התאמות של RoPE theta ואימון מדורג על כ־1.4 מיליארד טוקנים בסך הכול, שזה שבריר אחוז מנתוני האימון המקוריים של מטא.

במבחני שליפה מתוך טקסט ארוך, המפתחים מציגים דיוק מלא של מאה אחוז בחלק מהבדיקות, ובמבחן RULER המודל התברג בשביעייה הראשונה, כשרק מודלים כמו GPT-4 ו־Yi עקפו אותו במשימות איתור ושאלות ותשובות. מדובר בהישג חריג למשקל של שמונה מיליארד פרמטרים, שמצליח להחזיק כמות עצומה של טקסט רציף בלי לאבד את ההקשר לחלוטין.

מתאים ל

  • שליפת נתונים מתיקי מסמכים

    קריאת מאות קובצי תיעוד טכני או חוזים ארוכים באנגלית בבת אחת ושליפת עובדות מדויקות מתוכם.

  • תחקור לוגים וקוד

    הזנת מאגרי קוד שלמים או קובצי לוג עצומים לאיתור תקלות מערכת שמפוזרות על פני זמן רב.

  • צ'אט מקומי מעל ספרות

    מענה על שאלות מתוך ספרים שלמים או דוחות פיננסיים רחבים ישירות על מחשב מקומי חזק.

איפה זה נופל

המודל הוגדר ואומן עבור השפה האנגלית בלבד, ואין לו תמיכה רשמית בעברית או בשפות אחרות. מעבר לכך, אימון ההרחבה התבסס על 1.4 מיליארד טוקנים בלבד, כך שהיכולת שלו לנהל שיחה מורכבת ועמוקה לאורך מיליון טוקנים פחות יציבה מאשר יכולת השליפה הפשוטה שנמדדה בבדיקות. נוסף על כך, שימוש בגרסת ה־GGUF מחייב הגדרה ידנית של טוקן מיוחד כדי למנוע קריסה של פורמט הצ'אט.

אותה משפחה

Llama-3-8B-Instruct-Gradient יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ מיליון טוקנים על מחשב ביתי?

לא. טעינת המודל אמנם דורשת כ־15 גיגהבייט זיכרון, אך שמירת ההקשר של מיליון טוקנים בזיכרון דורשת עשרות ומאות גיגהבייט נוספים של זיכרון גרפי או מערכתי מהיר. על מחשב אישי תצטרכו להסתפק בגרסאות מכווצות ובחלון הקשר קצר בהרבה.

איך המודל עובד בעברית?

המודל מיועד באופן רשמי לאנגלית בלבד, בדיוק כמו מודל הבסיס של מטא. הוא עלול לייצר פלטים משובשים, להפגין קטיעות תחביריות או לתרגם רע מושגים, ולכן אינו מתאים למשימות קריטיות בעברית ללא כוונון נוסף.

מה נדרש להגדיר בהרצה עם llama.cpp?

בעבודה עם קובצי ה־GGUF שיצרה Crusoe, חובה להגדיר ידנית את המזהה 128009 כטוקן סיום מיוחד, אחרת מנגנון השיחה של Llama 3 לא יזהה נכון את סוף התשובות וימשיך להזות טקסט.

איך מריצים

המשקלים בפורמט bfloat16 תופסים כ־15 גיגהבייט זיכרון רק כדי להיטען, אבל חלון הקשר מלא דורש זיכרון עצום עבור ה־KV cache. לוקאלית אי אפשר להריץ מיליון טוקנים על כרטיס בודד, אלא אם משתמשים בגרסאות מכווצות כמו GGUF או MLX ב־4 ביט, וגם אז עם הגבלת אורך. המפתחים עצמם ממליצים להגביל את האורך בהרצה ב־vLLM לשלושים ושניים אלף טוקנים כברירת מחדל.

אם המטרה היא להריץ מאות אלפי טוקנים במכה אחת על בסיס קבוע, הקמה ותחזוקה של קלאסטר כרטיסים ייעודי תעלה ביוקר. במצב כזה, עדיף להשתמש בגרסה מנוהלת דרך ספקי ענן במקום לקנות חומרה כבדה רק בשביל המטמון.

from transformers import pipeline

pipe = pipeline("text-generation", model="gradientai/Llama-3-8B-Instruct-Gradient-1048k")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3 מבית מטא. הוא מאפשר שימוש מסחרי ומחקרי חופשי, כל עוד המוצר שלכם לא משרת מעל שבע מאות מיליון משתמשים פעילים בחודש, ומחייב ציות למדיניות השימוש המקובל של מטא ולמגבלות ספציפיות כמו איסור שימוש בתוצרי המודל לאימון מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗