GPT
L

L3-8B-Stheno-v3.2-GGUF

קוד פתוח

bartowskicc-by-nc-4.02024-06-12

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • conversational

גרסת כימות מקומית למודל L3-8B-Stheno-v3.2, שנבנתה כדי לתת מענה ליצירת טקסט חופשי ומשחקי תפקידים על חומרה ביתית סבירה בלי תלות בשרתים חיצוניים.

  • 99.4 GBמשקל הקבצים
  • 29,516הורדות בחודש
  • 55לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית Sao10K לפורמט GGUF באמצעות הגרסה העדכנית של llama.cpp. המטרה כאן היא לאפשר ריצה מקומית קלה ומהירה, כשהדגש הוא על משימות של יצירת טקסט, כתיבה חופשית ושיחה בסגנון שונה ממודלי בסיס סטנדרטיים של מטא. הכימות בוצע בעזרת imatrix, טכניקה שנעזרת בדאטה־סט מכויל כדי לשמור על דיוק המשקלים גם כשמכווצים את המודל בצורה אגרסיבית, במקום לחתוך ערכים בצורה עיוורת.

ההבדל העיקרי מול הפצות אחרות בגודל שמונה מיליארד פרמטרים הוא המגוון הרחב של הגרסאות המוכנות. יש כאן קבצים שנעים בין איכות כמעט מקורית בנפח של שמונה וחצי גיגה־בייט ועד גרסאות מכווצות במיוחד בנפח של פחות משלושה גיגה־בייט. זה אומר שאפשר להתאים אותו למגוון רחב של כרטיסי מסך בלי להמיר את המשקלים לבד, ומקבלים מודל שיודע לעקוב אחרי פורמט הפרומפט המובנה של Llama 3 בלי התעסקויות מיותרות.

מתאים ל

  • משחקי תפקידים מקומיים

    המודל מכוון במקור ליצירת דמויות ודיאלוגים עשירים באנגלית, בלי סינון נוקשה של מודלים ארגוניים.

  • סיוע בכתיבה יוצרת

    יצירת סיפורים, רעיונות ועלילות כשרוצים לרוץ מקומית על מחשב נייד או שולחני בלי אינטרנט.

  • ניסויי כימות בחומרה חלשה

    בדיקת ביצועים של שיטות כימות חדשות מסוג IQ על כרטיסי מסך עם זיכרון וידאו מוגבל של 4 עד 6 גיגה.

איפה זה נופל

הקובץ מוגדר לשפה האנגלית בלבד. מי שבונה עליו לעברית יגלה מהר מאוד שהוא מגמגם, מתרגם מילולית או פשוט מחזיר ג'יבריש ברגע שמעלים את רמת המורכבות. מעבר לזה, גרסאות הכימות הנמוכות, במיוחד ברמות של שניים ושלושה ביט, סובלות מירידה מורגשת ביכולת ההיגיון והדיוק. אם אתם צריכים שליפת נתונים מדויקת, עבודה עם קוד או מענה עובדתי, זה לא הכיוון, ויש סיכוי גבוה להזיות.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

הגרסאות המאוזנות ביותר הן Q4_K_M או Q5_K_M, ששוקלות סביב 5 גיגה ורצות בקלות על כרטיס מסך ביתי ממוצע עם שמונה גיגה זיכרון. אם המקום שלכם מוגבל במיוחד, גרסאות ה־IQ3 יספקו תוצאה נסבלת אבל ידרשו כרטיס תואם של אנבידיה או AMD כדי לא לזחול.

אפשר לבנות איתו בוט ללקוחות של עסק?

לא. הרישיון שבו הוא מופץ אוסר במפורש שימוש מסחרי מכל סוג שהוא, כך שאי אפשר להטמיע אותו במוצר עסקי. מעבר לזה, הוא מוגדר ומאומן בעיקר על אנגלית ולא מתאים לשירות לקוחות בעברית.

איך מריצים

בשביל להריץ אותו בצורה מהירה צריך לפחות 6 עד 8 גיגה זיכרון בכרטיס המסך עבור גרסאות כמו Q4_K_M או Q5_K_M, ששוקלות בין 4.9 ל־5.7 גיגה־בייט ומספקות את האיזון הטוב ביותר. אם המטרה היא להוריד את המשקל למינימום, גרסאות ה־IQ החדשות מציעות איכות סבירה בנפח של פחות מארבעה גיגה, אבל דורשות תמיכה ספציפית ב־cuBLAS או ב־ROCm כדי לא לפגוע בביצועים על כרטיסי AMD או מעבדים רגילים.

אם יש לכם כרטיס גרפי ביתי עם 8 גיגה זיכרון, שווה להריץ אותו מקומית ולקבל שליטה מלאה על הפרטיות וזמני התגובה. אם אין לכם חומרה ייעודית או שאתם מתכננים להריץ גרסאות דחוסות מדי כמו Q2 על המעבד בלבד, האיכות והמהירות ייפגעו לרמה שעדיף לשלם לפי שימוש ל־API מנוהל.

ollama run hf.co/bartowski/L3-8B-Stheno-v3.2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש במודל הזה לכל מטרה מסחרית. הוא מיועד לניסויים אישיים, מחקר או פיתוח מקומי בלבד, וחובה לתת קרדיט ליוצר המקורי. אם אתם מתכננים לשלב אותו באפליקציה בתשלום או במוצר שמייצר הכנסה, תצטרכו לחפש מודל אחר עם רישיון שמאפשר שימוש מסחרי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗