GPT
L

Llama-2-7B-32K-Instruct-GGUF

קוד פתוח

TheBlokellama22023-09-05

  • transformers
  • gguf
  • llama
  • en

גרסת GGUF מכווצת למודל של Together שמרחיב את לאמה המקורית לעבודה עם מסמכים ארוכים. המטרה כאן היא להריץ מודל שיחה מקומי שיכול לקבל טקסטים של עשרות אלפי מילים בלי לקרוס.

  • 47.7 GBמשקל הקבצים
  • 3,173הורדות בחודש
  • 53לייקים

מה זה

המודל מבוסס על שבעה מיליארד פרמטרים של מטא, שעבר אימון נוסף אצל חברת Together במטרה להתמודד עם חלון הקשר של 32 אלף טוקנים. החידוד שלו כלל שילוב של שיחות מזוקקות ממודלים חזקים יותר לצד סיכום ספרים ומענה על שאלות מתוך מסמכים מרובים, כך שהוא מכוון ספציפית לטיפול בטקסט ארוך. הגרסה הזו כוללת המרה וכימוץ לפורמט GGUF בידי TheBloke, מה שמאפשר להריץ אותו ישירות דרך מעבד, זיכרון מחשב או כרטיס מסך ביתי.

במבחני ביצועים על משימות של טקסטים ארוכים הוא מציג שיפור משמעותי לעומת מודל הבסיס הרגיל, שלא מסוגל להתמודד עם עומסים כאלה. במבחן סיכום הספרים BookSum הוא עקף את GPT 3.5 Turbo 16K במדדי Rouge, ובמבחן שאלות מתוך 50 מסמכים הגיע לדיוק של 0.589 לעומת 0.354 של מודל הבסיס. יחד עם זאת, במבחן שיחה רגיל כמו Alpaca Eval הוא מקבל ציון של 70.36 אחוזי ניצחון, שזה מעט נמוך מגרסת הצ'אט המקורית. כלומר, ההתמחות שלו היא סריקת מידע ארוך ולא התחכמות לשונית כללית.

מתאים ל

  • סיכום ספרים ומאמרים ארוכים

    מתאים להזנת קבצים של עשרות עמודים לצורך תמצות נקודות עיקריות באנגלית בלי לחתוך את הטקסט לחלקים.

  • שליפת מידע מכמה מסמכים

    טוב להרצת שאלות ותשובות מקומיות מתוך מקבץ דוחות או מאגר פנימי של עשרות קבצים במקביל.

  • בניית צ'אטבוט מקומי מבוסס ידע

    מאפשר לשמור היסטוריית שיחה ארוכה מאוד בלי לאבד הקשר ובלי לחשוף מידע לשירותי ענן חיצוניים.

איפה זה נופל

המודל הזה אומן רק על אנגלית, והכרטיס לא מציין תמיכה בעברית או בשפות אחרות. מעבר לזה, מדובר במודל קטן של שבעה מיליארד פרמטרים, והמפתחים מציינים במפורש שהוא עלול לפלוט עובדות שגויות, הזיות או טקסט מוטה. הדיוק שלו במענה על עשרות מסמכים עומד סביב 59 אחוז בלבד, כך שאי אפשר להסתמך עליו בעיניים עצומות למשימות קריטיות ללא אימות אנושי של התוצאות.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל יצליח לקרוא ולסכם מסמכים בעברית?

הכרטיס מפרט אנגלית בלבד כשפת המודל. הוא לא עבר התאמה לעברית, ולכן ניסיון להזין לו טקסט מקומי ארוך יוביל כנראה לטעויות קשות או לפלט משובש.

איזה קובץ כדאי לי להוריד מתוך כל הרשימה?

עבור רוב האנשים קובץ Q4_K_M הוא הבחירה הנכונה. הוא שוקל כארבעה גיגה בייט, מאזן היטב בין איבוד איכות למהירות, ועובד חלק על מחשבים עם מעט זיכרון פנוי.

איך מריצים

קובץ הבסיס המומלץ לרוב השימושים הוא Q4_K_M ששוקל 4.08 גיגה בייט ודורש בערך 6.58 גיגה זיכרון כדי לפעול על המעבד, או פחות מזה בזיכרון גרפי אם פורקים את השכבות לכרטיס מסך. אם אתם חנוקים במקום אפשר לרדת לגרסאות 3 ביט, אבל מתחת לזה איבוד האיכות מורגש מדי. מי שרוצה מקסימום איכות מקומית יכול לקחת את Q5_K_M או Q6_K, הדורשות בין שבעה לשמונה גיגה זיכרון.

מריצים אותו בקלות דרך כלי קוד פתוח כמו llama.cpp, תוכנות שולחניות כמו LM Studio או בספריות פייתון כמו ctransformers. צריך לזכור שהגדלת ההקשר בפועל עד לקצה של 32 אלף טוקנים דורשת זיכרון נוסף להחזקת הנתונים. אם אין לכם חומרה ייעודית ואתם צריכים לנתח עשרות מסמכים בו זמנית בזמן אמת, קריאה לשרת ענן חיצוני תעבוד מהר יותר מהרצה על מחשב אישי.

ollama run hf.co/TheBloke/Llama-2-7B-32K-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama2 של מטא. הוא מאפשר שימוש מסחרי חופשי כל עוד המוצר שלכם לא פונה ליותר משבע מאות מיליון משתמשים פעילים בחודש, ומחייב לשמור על תנאי השימוש המקובלים של מטא ומיתוג המודל המקורי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗