GPT
L

Llama-3-8B-Instruct-262k

קוד פתוח

gradientaillama32024-04-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • meta

גרסה מורחבת של לאמה 3 שמביאה חלון הקשר של 262 אלף טוקנים לגודל שמונה מיליארד. פתרון מתאים למי שחייב לנתח מסמכי ענק מקומית בלי לקפוץ למודלי 70B כבדים ויקרים.

  • 8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 1,358הורדות בחודש

מה זה

גרדיאנט לקחו את המודל המקורי של מטא, שהוגבל לשמונת אלפים טוקנים בלבד, ומתחו אותו לחלון הקשר של 262,144 טוקנים. הם עשו את זה באמצעות התאמות בפרמטר RoPE theta ואימון מדורג בכמויות דאטה קטנות יחסית של פחות ממאתיים מיליון טוקנים, תוך שימוש בספריית EasyContext Blockwise RingAttention על גבי תשתיות מחשוב של Crusoe Energy.

התוצאה היא יכולת להכיל ספרים שלמים או מאות עמודי קוד בפרומפט יחיד על גבי ארכיטקטורת שמונה מיליארד פרמטרים. מבחן המחט בערימת שחת שנערך על המודל הראה יכולת איתור מידע מדויקת לאורך טווחים ארוכים, מה שפותר את מגבלת האורך החמורה של גרסת המקור בלי לפגוע בהתנהגות הצ'אט הבסיסית שעברה כוונון ייעודי נוסף.

מתאים ל

  • ניתוח מאגרי קוד שלמים

    חלון של 262 אלף טוקנים מאפשר להזין תיקיות פרויקט שלמות כדי לאתר באגים או להבין תלויות בלי לפצל קבצים.

  • תמצות מסמכים וחוזים ארוכים

    המודל מסוגל לקרוא דוחות כספיים או תיעוד טכני עבה בפעימה אחת במקום להסתמך על פירוק RAG מורכב.

  • צ'אט מבוסס היסטוריה ממושכת

    מתאים לסוכנים אוטונומיים שמנהלים שיחות ארוכות מאוד וצריכים לזכור פרטים שנאמרו בתחילת הדיון.

איפה זה נופל

האימון על ההקשר הארוך התבסס על פחות ממאתיים מיליון טוקנים, כמות זעירה בהשוואה לטריליוני הטוקנים של אימון הבסיס. המודל עלול לאבד קוהרנטיות, להמציא עובדות או לפספס פרטים עדינים בניתוח עומק של טקסטים מורכבים מאוד, מעבר לשליפה ישירה שנבדקה במבחני המחט. בנוסף, המודל אומן ומיועד רשמית לשפה האנגלית בלבד, ואינו כולל התאמה רשמית לעברית. תאריך הידע של נתוני הבסיס נעצר במרץ 2023.

שאלות
נפוצות

האם המודל יפעל טוב בעברית?

התיעוד מגדיר את המודל כמיועד לאנגלית בלבד. אף על פי שלאמה 3 מסוגל לפלוט טקסט בעברית ברמה מסוימת, אימון ההקשר הארוך בוצע על נתונים באנגלית, ולכן ביצועיו בטקסטים ארוכים בעברית אינם מובטחים ודורשים בדיקה זהירה.

כמה זיכרון דרוש כדי לנצל את כל חלון ההקשר?

המשקלים דורשים כ־16 ג'יגה בייט בפורמט המקורי, אך שמירת היסטוריה של 262 אלף טוקנים בזיכרון דורשת עשרות ג'יגה בייט נוספים עבור ה־KV Cache. תצטרכו כרטיסי שרת חזקים, או שימוש בקוונטיזציה נמוכה ושיטות ניהול זיכרון מתקדמות.

איך מריצים

המשקל המקורי בפורמט bfloat16 תופס 15 ג'יגה בייט של זיכרון ומחייב מעבד גרפי של 24 ג'יגה בייט כמו RTX 3090 או A10 לפחות, וזה עוד לפני שמחשבים את זיכרון ה־KV Cache שמתנפח בצורה משמעותית כשמנצלים את מלוא 262 אלף הטוקנים. בשביל להריץ אותו באמת בהקשרים מלאים תצטרכו שרתי שרתים ייעודיים כמו L40S שעליהם הוא אומן.

למי שרוצה לעבוד מקומית קיימות גרסאות מכווצות בפורמט GGUF וגרסאות Exl2 בטווחים של חמישה עד שמונה ביט. אם המטרה היא שליחה מזדמנת של קבצים ענקיים ואין ברשותכם כרטיסי שרת עם עשרות ג'יגה בייט פנויים להקשר, עדיף להשתמש בנקודות קצה ענניות שמחזיקות את החומרה המתאימה.

from transformers import pipeline

pipe = pipeline("text-generation", model="gradientai/Llama-3-8B-Instruct-262k")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3 מבית מטא. הרישיון מאפשר שימוש מסחרי ומחקר באופן חופשי, כל עוד המוצר שלכם לא חוצה רף של 700 מיליון משתמשים פעילים בחודש, שאז נדרש אישור מפורש ממטא. כמו כן חלה חובת ציות למדיניות השימוש המקובל של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗