GPT
Y

Yarn-Mistral-7B-128k-GGUF

קוד פתוח

TheBlokeapache-2.02023-11-02

  • transformers
  • gguf
  • mistral
  • en

גרסה מכווצת של מודל שבעה מיליארד פרמטרים עם חלון הקשר ענקי של 128 אלף טוקנים. היא מיועדת למי שצריך להריץ לוקאלית משימות על מסמכים ארוכים בלי להחזיק שרת יקר.

  • 51.2 GBמשקל הקבצים
  • 3,002הורדות בחודש
  • 129לייקים

מה זה

הבסיס כאן הוא מודל שבעה מיליארד של מיסטרל שעבר אימון המשך על ידי נואוס ריסרץ' בשיטת יארן כדי להרחיב את חלון ההקשר מ־8 אלף ל־128 אלף טוקנים. דה בלוק לקח את המשקלים והמיר אותם לפורמט ג'י ג'י יו אף, שמאפשר להריץ אותו ישירות במעבד ובכרטיסי מסך ביתיים דרך תוכנות מבוססות לאמה סי פי פי.

במדדי פרפלקסיטי על טקסטים ארוכים, המודל שומר על רציפות טובה שמגיעה לציון 2.19 ב־128 אלף טוקנים, לעומת 3.08 ב־8 אלף. המשמעות היא שככל שהטקסט מתארך המודל עדיין מבין את ההקשר ומנבא מילים בצורה עקבית. במבחנים סטנדרטיים של הקשר קצר כמו אם אם אל יו או הלאסווג יש ירידה קלה של אחוז עד שלושה אחוזים לעומת מודל המקור, אבל היכולת הכללית נשמרת.

מתאים ל

  • ניתוח מסמכים ארוכים

    קריאה של ספרים, חוזים או דוחות ענק באנגלית והוצאת מסקנות ברצף אחד של עד 128 אלף טוקנים.

  • השלמת קוד בפרויקטים

    טעינה של מספר קובצי קוד מקור יחד כדי שהמודל יבין את כל מבנה המערכת לפני הצעת שינויים.

  • הרצה מקומית על מחשב יחיד

    עבודה עם זיכרון ראם צנוע יחסית דרך לאמה סי פי פי בלי לשלוח מידע רגיש לשרתים חיצוניים.

איפה זה נופל

זהו מודל בסיס שלא עבר התאמה לשיחה או להוראות, ואין לו תבנית פרומפט מובנית. אם תזרקו לו שאלה רגילה, הוא עלול להמשיך את הטקסט במקום לענות עליה. המודל מוגדר רשמית רק באנגלית, ולכן התמודדות עם עברית או עם מסמכים מקומיים תהיה בעייתית ומועדת לשגיאות. הגרסאות המכווצות ביותר, כמו קיו שתיים או קיו שלוש, סובלות מירידה ניכרת באיכות הפלט והכרטיס עצמו ממליץ להימנע מהן.

אותה משפחה

Yarn-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ועונה בעברית?

האימון וההרחבה הוגדרו עבור אנגלית בלבד. המודל הבסיסי לא עבר התאמה לעברית, ולכן ניסיון להזין לו מסמכים בעברית יוביל לפלטים מקוטעים, חוסר הבנה והזיות.

איזה קובץ בדיוק צריך להוריד מתוך הרשימה?

אין צורך להוריד את כל המאגר. הקובץ המאוזן והמומלץ ביותר לרוב המחשבים הוא yarn-mistral-7b-128k.Q4_K_M.gguf ששוקל 4.37 ג'יגה בייט ונותן יחס מעולה בין מהירות לאיכות.

אפשר להשתמש בו ישירות כעוזר צ'אט?

לא מומלץ בלי הכנה מראש, כי המודל לא עבר כוונון להוראות או לשיחה. כדי לקבל תשובות בסגנון צ'אט תצטרכו להנדס את הפרומפט בקפידה או להריץ אותו עם דוגמאות מנחות.

איך מריצים

מורידים רק קובץ אחד מתוך המאגר, ולא את כל החמישים ואחד ג'יגה בייט. לרוב המשתמשים מומלץ לקחת את גרסת קיו ארבע קיי אם ששוקלת 4.37 ג'יגה בייט ודורשת קצת פחות משבעה ג'יגה בייט זיכרון כדי לרוץ על המעבד, או את קיו חמש קיי אם שדורשת סביב שמונה ג'יגה בייט. אם יש כרטיס מסך עם שמונה או שנים עשר ג'יגה בייט זיכרון ייעודי, פורקים אליו שכבות עם לאמה סי פי פי כדי לקבל קצב תגובה מהיר.

ההרצה המקומית הגיונית אם יש לכם צורך בפרטיות מוחלטת או רצון להימנע מעלויות שוטפות. אם אתם צריכים לפתוח את כל מאה עשרים ושמונה אלף הטוקנים בתדירות גבוהה, כדאי לדעת שזיכרון ההקשר המקומי יזלול משאבים במהירות, ובמצב כזה שירות ענן חיצוני עשוי להיות מהיר ויציב יותר.

ollama run hf.co/TheBloke/Yarn-Mistral-7B-128k-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. הוא מאפשר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים או פתוחים ללא תשלום תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗