GPT
M

MN-Violet-Lotus-12B-GGUF

קוד פתוח

mradermachercc-by-4.02024-11-17

  • transformers
  • gguf
  • storywriting
  • text adventure
  • creative

גרסה מכווצת בפורמט GGUF של מודל 12B שפותח במקור על ידי FallenMerick. הוא פונה למי שמחפש להריץ מודל טקסט מקומי באנגלית בלי לשרוף תקציב על שרתי ענן.

  • 85.5 GBמשקל הקבצים
  • 11,983הורדות בחודש
  • 90לייקים

מה זה

מדובר בהמרה של המודל המקורי לחבילת קבצים סטטיים שמיועדים להרצה מקומית. הדף של הממיר לא מפרט מה בדיוק עבר המודל המקורי, אילו שברי דאטהסט הוזנו אליו או מה אופי הטקסטים שהוא מפיק, אבל השם רומז על בסיס ממשפחת Mistral NeMo. מכיוון שמדובר בגודל ביניים של 12 מיליארד פרמטרים, המטרה כאן היא לתת מענה שמציג יכולות סבירות בלי לדרוש מערך חומרה כבד מדי.

היתרון המרכזי בחבילה הוא המגוון הרחב של הכיווצים הסטטיים שהועלו. הממיר מציע פתרונות שנעים בין איכות נמוכה אך חסכונית במיוחד לבין קבצים ששומרים כמעט על מלוא הדיוק, מה שמאפשר לבחור בדיוק את נקודת האיזון בין מהירות לזיכרון עבודה בהתאם למחשב שבו עובדים.

מתאים ל

  • עוזר מקומי באנגלית

    מתאים לשיחה ועיבוד טקסט באנגלית במחשב אישי עם כרטיס גרפי בינוני.

  • ניסויי קוונטיזציה

    מאפשר לבדוק ביצועים וקצבי ריצה של רמות דחיסה שונות בפורמט GGUF.

  • פיתוח על מעבדי ARM

    כולל קובץ ייעודי שמספק מהירות הרצה גבוהה יותר על חומרת ARM תואמת.

איפה זה נופל

הכרטיס לא מספק נתונים על יכולות המודל, מבחני ביצועים או מגבלות התוכן שלו, ולכן צריך לבדוק אותו מאפס לפני כל שימוש אמיתי. בנוסף, השפה המוגדרת בו רשמית היא אנגלית בלבד. אם תנסו לעבוד איתו בעברית, סביר להניח שתקבלו פלט שבור או משפטים חסרי הגיון, כי אין שום תיעוד על אימון רב לשוני. הגרסאות הקטנות ביותר בדף מוגדרות מראש כבעלות איכות נמוכה ולא מתאימות למשימות שדורשות דיוק.

שאלות
נפוצות

האם המודל יבין עברית?

לא מומלץ לבנות על זה. המודל מוגדר עם תמיכה באנגלית בלבד ואין שום פירוט על אימון בשפות נוספות. תוצאות בעברית יהיו כנראה באיכות נמוכה מאוד.

איזה קובץ הכי כדאי להוריד מהרשימה?

הכרטיס ממליץ במפורש על גרסאות Q4_K_M או Q4_K_S. הן שוקלות סביב 7.5 גיגה בייט ומספקות שילוב מאוזן בין מהירות תגובה לאיכות פלט, בלי להעמיס יתר על המידה על הזיכרון.

איך מריצים

בשביל להריץ אותו צריך תוכנה שתומכת בקובצי GGUF כמו llama.cpp. המשקלים של הקבצים הבודדים נעים בין 4.9 גיגה בייט לקובץ הכי מכווץ ועד 13.1 גיגה בייט עבור גרסת שמונה ביט. אם יש לכם כרטיס מסך עם שמונה או שנים עשר גיגה זיכרון, גרסאות כמו Q4_K_M או Q5_K_S יכנסו לתוכו בלי בעיה ויתנו קצב עבודה סביר.

אם אתם על מעבדי ARM, הכרטיס מציע גרסה מותאמת בשם Q4_0_4_4 שרצה מהר יותר אך מקריבה איכות. למי שאין כרטיס גרפי מתאים ואינו מוכרח פרטיות מוחלטת על החומרה המקומית, עדיף להשתמש בשרת מרוחק במקום לנסות להריץ גרסאות גדולות על מעבד רגיל.

ollama run hf.co/mradermacher/MN-Violet-Lotus-12B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקבצים והפצה מחודשת שלהם בחינם או בתשלום. התנאי המרכזי והמחייב הוא מתן קרדיט ברור ליוצר המקורי וציון שינויים שנעשו, אם נעשו כאלה, במסמכי המוצר או בממשק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗