GPT
D

dolphin-2_2-yi-34b-GGUF

קוד פתוח

TheBlokeother2023-11-13

  • transformers
  • gguf
  • yi
  • en

גרסת GGUF שעברה כימות למודל Yi בגודל 34 מיליארד פרמטרים, שעבר כוונון ייעודי להסרת מגבלות תוכן. הוא מיועד למי שצריך מודל חזק שרץ מקומית ועונה על כל הוראה בלי לסרב.

  • 243 GBמשקל הקבצים
  • 1,818הורדות בחודש
  • 46לייקים

מה זה

מדובר בהמרה של אריק הרטפורד על בסיס Yi-34B בגרסה מותאמת ל־Llama, שנועדה לתת מענה מלא לבקשות משתמש ללא מנגנוני סינון מובנים. המודל אומן בשיטת qLoRA במשך שלושה ימים על גבי ארבעה כרטיסי A100 תוך שימוש ב־Axolotl, ומבוסס על שילוב נתונים מפרויקט Orca של מיקרוסופט, Airoboros ליצירתיות, וחלקים מ־Samantha ו־WizardLM.

בגרסה זו הושם דגש על שיחות מרובות שלבים והבנת שיח טבעית יותר. המודל תומך בחלון הקשר של 16,000 טוקנים ומאולף לעבוד במבנה הפרומפט של ChatML, מה שמאפשר לו לנהל הקשר ארוך יחסית למודלים בקטגוריית הגודל הזו.

מתאים ל

  • עבודה ללא סינונים מובנים

    מתאים לניתוח טקסטים רגישים או מחקר שבהם מודלים מסחריים מסרבים לענות עקב מנגנוני בטיחות מחמירים.

  • שיחות מרובות שלבים

    אומן ייעודית לשיח ממושך ומעקב אחר הקשר בפורמט ChatML עד 16 אלף טוקנים.

  • הסקה מקומית על כרטיס יחיד

    בכימות Q4_K_M המודל נכנס במלואו לכרטיסי מסך עם 24GB זיכרון ומאפשר ריצה פרטית ומבודדת.

איפה זה נופל

היוצר מציין במפורש שהמודל עבר הסרה מלאה של מנגנוני בטיחות וסינון הטיה, ולכן הוא יענה לכל פקודה, כולל בקשות זדוניות או לא אתיות. אם אתם מתכננים לחשוף אותו למשתמשי קצה, חובה לבנות שכבת בדיקות וסינון חיצונית משלכם. בנוסף, גרסאות הכימות הנמוכות כמו Q2_K ו־Q4_0 מוגדרות כבעלות ירידה משמעותית מאוד באיכות התוצרים, ובכרטיס המודל לא מופיעים מבחני ביצועים כמותיים.

שאלות
נפוצות

איזה קובץ לבחור מתוך הרשימה?

הקובץ המומלץ לשימוש מאוזן הוא dolphin-2_2-yi-34b.Q4_K_M.gguf, ששוקל 20.66 גיגה-בייט ושומר על איכות טובה. אם יש לכם כרטיס מסך גדול יותר, גרסאות Q5_K_M יתנו תוצאה מעט מדויקת יותר, אך מומלץ להימנע מגרסאות Q2 ו־Q4_0 שמאבדות מאיכותן.

האם המודל בטוח לחיבור ישיר למשתמשים באתר?

לא. המודל אינו כולל שום סינון או התאמה מוסרית, ויבצע כל הוראה שיקבל בלי לסרב. שילוב שלו במערכת שפונה לציבור מחייב שכבת תיווך וסינון קלט ופלט שאתם תפתחו.

איזה מבנה פנייה המודל מבין הכי טוב?

הוא אומן על מבנה ChatML. שימוש בתגיות system, user ו־assistant בדיוק לפי הפורמט שמופיע בהגדרות מבטיח שהוא יבין את ההקשר ולא ייכנס ללופים.

איך מריצים

כדי להריץ אותו תצטרכו לבחור קובץ יחיד מתוך המאגר בהתאם למגבלות הזיכרון. קובץ ה־Q4_K_M שוקל 20.66 גיגה-בייט ודורש לפחות 23.16 גיגה-בייט של זיכרון עבודה בריצה על מעבד, או כרטיס מסך מודרני עם לפחות 24 גיגה-בייט זיכרון כדי לפרוק אליו את כל השכבות. קבצים מכווצים יותר כמו Q2_K יורדים לאזור ה־14.56 גיגה-בייט אך מגיעים עם פגיעה מורגשת באיכות.

ההרצה מתבצעת ישירות דרך כלי llama.cpp, ממשקים כמו LM Studio ו־text-generation-webui, או בספריות פייתון דוגמת ctransformers ו־llama-cpp-python. אם אין לכם חומרה ייעודית עם זיכרון מספק, קריאה לשרת מרוחק עדיפה בהרבה על ניסיון להריץ 34 מיליארד פרמטרים על מעבד רגיל בלבד.

ollama run hf.co/TheBloke/dolphin-2_2-yi-34b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ונשען על תנאי הרישיון המקוריים של Yi. הוא אינו מוגדר כקוד פתוח סטנדרטי דוגמת MIT או אפאצ'י, ולכן לפני שימוש מסחרי או הפצה במוצר חובה לבדוק את ההגבלות המשפטיות במסמכי המקור של Yi.

הרישיון המלא בעמוד המודל ↗