GPT
Y

Yi-34B-GGUF

קוד פתוח

TheBlokeother2023-11-04

  • transformers
  • gguf
  • yi

גרסת קוונטיזציה של מודל שפיתחה 01-ai, שמתאימה למי שמחפש ביצועים של מודלים ענקיים בגודל ביניים שעדיין אפשר לדחוס לחומרה מקומית סבירה.

  • 243 GBמשקל הקבצים
  • 1,710הורדות בחודש
  • 77לייקים

מה זה

מדובר במודל בסיס דו לשוני באנגלית ובסינית עם 34 מיליארד פרמטרים, שהוסב כאן לפורמט GGUF להרצה מקומית. הוא אומן על אורך הקשר מקורי של 4K עם יכולת הרחבה ל־32K בזמן ריצה, ומציג שילוב שקשה למצוא מחוץ למודלי ענק. במבחני השוואה שפורסמו בכרטיס המודל, הוא עוקף את LLaMA2-70B במבחנים כמו MMLU עם ציון של 76.3 לעומת 68.9, וגם ב־BBH עם 54.3 לעומת 51.2.

התוצאות האלה אומרות שבמשימות שדורשות הבנת שפה כללית וידע עולם, המשקל שלו מנוצל טוב בהרבה מהדורות הקודמים. הוא לא דורש את משאבי העתק של מודלי 70B כדי לתת תשובות ברמה תחרותית. מצד שני, זהו מודל בסיס ולא מודל שעבר כוונון ייעודי לצ'אט או הוראות, ולכן הוא דורש עבודה מדויקת עם פרומפטים כדי להוציא ממנו תוצאות עקביות.

מתאים ל

  • הבנת טקסטים באנגלית וסינית

    המודל מוביל במבחני שפה דו לשוניים עם 83.7 ב־CMMLU ומציג יכולות קריאה והסקה חזקות.

  • מענה לשאלות ידע כללי

    עם ציון של 76.3 ב־MMLU הוא מספק דיוק גבוה בהרבה מרוב המודלים הפתוחים בקטגוריית המשקל שלו.

  • חילוץ מידע מהקשרים ארוכים

    הארכיטקטורה תומכת בהרחבת ההקשר עד 32K טוקנים, מה שמאפשר לעבד מסמכים ארוכים בריצה מקומית.

איפה זה נופל

הנקודה החלשה ביותר שלו היא תחום המתמטיקה והקוד. במבחנים אלה הוא מקבל 37.1 בלבד, ציון שנמוך אפילו מ־Qwen-14B שמגיע ל־39.8 למרות גודלו הצנוע. אם המטרה היא כתיבת קוד, הוא יתקשה מאוד לתת עבודה יציבה.

בנוסף, המפתחים מצהירים מראש שהם לא מבטיחים פלט תקין או הגיוני בכל תרחיש, ושיש סיכון לפלטים שגויים או מטעים. מאחר שמדובר במודל בסיס שאומן על אנגלית וסינית, אין לצפות ממנו להבנה אמינה בעברית ללא כוונון נוסף, וכל הטמעה שלו במערכת דורשת בדיקות קפדניות של סינון תוכן.

אותה משפחה

Yi יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך המאגר?

הקובץ המומלץ לרוב השימושים הוא yi-34b.Q4_K_M.gguf. הוא שוקל 20.66 גיגה בייט ומאזן היטב בין איכות התוכן לגודל הזיכרון הנדרש. גרסאות נמוכות מ־4 ביט גורמות לירידה חדה מדי באיכות.

האם המודל מתאים לעבודה בעברית?

לא כדאי להסתמך עליו בעברית. המודל אומן מראש כמודל דו לשוני באנגלית ובסינית בלבד. כל פלט בשפות אחרות עלול להיות משובש, מקוטע או לא מדויק.

האם אפשר להשתמש בו ישירות כצ'אטבוט?

זהו מודל בסיס ולא מודל שעבר אימון הנחיות. כדי לנהל איתו שיחה תצטרכו להקפיד על מבנה הפרומפט המדויק שהוגדר לו, או לעבוד עם כלי הרצה שתומכים במבנה השיחה שלו.

איך מריצים

בשביל להריץ אותו צריך להוריד קובץ בודד מהמאגר ולא את כל 243 הגיגה בייט. גרסת Q4_K_M שוקלת כ־20.66 גיגה בייט ודורשת לפחות 23.16 גיגה בייט זיכרון. אם אין לכם כרטיס מסך עם 24 גיגה בייט VRAM לפחות, כמו RTX 3090 או A10, תצטרכו להריץ אותו על המעבד וה־RAM דרך llama.cpp, או לפצל שכבות בין המעבד לכרטיס, מה שיוריד את קצב היצירה באופן מורגש.

גרסאות 2 ביט ו־3 ביט חוסכות מקום אבל מגיעות עם פגיעה משמעותית באיכות הפלט, בעוד גרסאות 5 ו־6 ביט דורשות מעל 26 גיגה בייט זיכרון. אם השרת המקומי שלכם חלש מזה ואתם צריכים תגובות מהירות בזמן אמת, הרצה עצמית פשוט לא תשתלם מול שימוש ב־API חיצוני.

ollama run hf.co/TheBloke/Yi-34B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר בתור other ומבוסס על הסכם הרישיון של 01-ai. הוא חופשי לחלוטין למחקר אקדמי, אך שימוש מסחרי מותנה בקבלת אישור מראש דרך פנייה למפתחים. מי שבונה מוצר מסחרי לא יכול פשוט לפרוס אותו בענן בלי אישור רשמי במייל מיוצרי המודל.

הרישיון המלא בעמוד המודל ↗