GPT
Y

Yarn-Llama-2-13B-128K-GGUF

קוד פתוח

TheBlokellama22023-09-01

  • transformers
  • gguf
  • llama

גרסה מכווצת של מודל המבוסס על Llama 2 שהורחב לחלון של 128K טוקנים. מתאים למי שחייב לעבד טקסטים ארוכים מקומית ובזול יחסית.

  • 91.9 GBמשקל הקבצים
  • 3,283הורדות בחודש
  • 37לייקים

מה זה

מדובר בהמרה לפורמט GGUF של מודל 13B שעבר אימון המשך על נתוני PG19 כדי למתוח את חלון ההקשר המקורי הרבה מעבר לרגיל. המודל פותח על ידי NousResearch ועבר כימות על ידי TheBloke כדי לאפשר הרצה על מעבדים וכרטיסי מסך ביתיים דרך ספריות כמו llama.cpp.

הייחוד כאן הוא שיטת YaRN שנועדה לאפשר קריאה של מסמכים שלמים בלי לשבור את המבנה של המודל המקורי. הכרטיס המקורי לא מציג תוצאות של מבחני ביצועים, והסעיף סומן כלא גמור, כך שאין נתונים רשמיים על הירידה באיכות ביחס למודל הבסיס ככל שמתקרבים לקצה חלון ההקשר.

מתאים ל

  • השלמת מסמכים ארוכים

    מאפשר לעבד ספרים ומאמרים רחבים בלי לחתוך את הקלט, בזכות חלון של 128K טוקנים.

  • אימון והתאמה אישית

    משמש נקודת מוצא טובה למי שרוצה לאמן מודל שיחה שיודע לקרוא טקסטים גדולים מקומית.

  • הרצה מקומית במחשב יחיד

    מתאים למי שחייב פרטיות מוחלטת ומחזיק כרטיס מסך ממוצע עם 12 עד 16 גיגה זיכרון.

איפה זה נופל

זהו מודל בסיס גולמי ללא שום כיוונון להוראות או לצ'אט, ולכן הוא לא יודע לענות לשאלות ישירות אלא רק להשלים טקסט. אי אפשר פשוט לזרוק אליו שאלה ולצפות לתשובה מנומקת בלי לעטוף את זה במבנה פרומפט מתאים או לאמן אותו הלאה.

האימון הנוסף כלל 600 צעדים בלבד, ויוצרי המודל ציינו במפורש שביצועי ההקשר הארוך דורשים שיפור נוסף וכיוונון עדין בעתיד.

שאלות
נפוצות

האם המודל מוכן לשימוש ישיר כצ'אטבוט?

לא. המודל פורסם ללא כיוונון שיחה, והוא מיועד להשלמת טקסט בלבד. כדי להשתמש בו לצ'אט תצטרכו להוסיף שכבת הנחיות ברורה או לאמן אותו.

איזה קובץ כדאי להוריד מתוך כל האפשרויות?

גרסת Q4_K_M היא נקודת ההתחלה המאוזנת לרוב המערכות, עם גודל של 7.87 גיגה בייט. אם יש לכם מספיק זיכרון ואתם רוצים פחות פגיעה באיכות, עברו ל־Q5_K_M.

איך מריצים

להרצה מקומית תצטרכו להוריד קובץ בודד בהתאם לחומרה שלכם. מדרגת הביניים המומלצת היא Q4_K_M ששוקלת 7.87 גיגה בייט ודורשת לפחות 10.37 גיגה בייט של זיכרון ללא פריקה למעבד הגרפי, בעוד גרסאות מדויקות יותר כמו Q5_K_M מגיעות ל־9.23 גיגה בייט ודורשות מעל 11.7 גיגה בייט זיכרון. מי שרוצה איכות מקסימלית בלי כימות אגרסיבי יצטרך לפחות 16 גיגה בייט זיכרון לגרסת Q8_0.

אפשר להריץ אותו דרך llama.cpp, ממשקי משתמש כמו LM Studio או ישירות מקוד פייתון עם ספריית ctransformers. אם אין לכם לפחות 12 גיגה בייט של זיכרון פנוי בכרטיס המסך או במחשב, עדיף להשתמש במודל מרוחק דרך שירות ענן.

ollama run hf.co/TheBloke/Yarn-Llama-2-13B-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל כפוף לרישיון llama2 המקורי. הרישיון מאפשר שימוש מסחרי לרוב החברות, אך מחייב אישור מיוחד אם המוצר שלכם מגיע ליותר מ־700 מיליון משתמשים פעילים בחודש. בנוסף, חלות הגבלות השימוש הרגילות שהוגדרו על ידי חברת מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗