GPT
G

goliath-120b-GGUF

קוד פתוח

TheBlokellama22023-11-09

  • transformers
  • gguf
  • llama
  • conversational
  • en

זה מיזוג של שני מודלים שונים בגודל 70B לרשת ענקית אחת. בוחרים בו כשמחפשים יכולת הבעה ושיחה עמוקה באנגלית ומחזיקים שרת חזק מספיק להריץ אותה מקומית.

  • 828 GBמשקל הקבצים
  • 563הורדות בחודש
  • 139לייקים

מה זה

היוצר Alpin לקח שני מודלים מכווננים שמבוססים על Llama-2 70B, את Xwin ואת Euryale, וחיבר את השכבות שלהם בשיטת שזירה לסירוגין. במקום לאמן משקלים חדשים מאפס, המבנה הזה נשען על חפיפה בין מקטעי שכבות שונים כדי לייצר מודל עם 120 מיליארד פרמטרים. התוצאה היא מודל שמכוון ליצירת טקסט, מענה עשיר ומשחקי תפקידים, כשהוא משתמש בתבנית הפרומפט של Vicuna או Alpaca.

המאגר הזה מציג המרות שביצע TheBloke לפורמט GGUF, שמיועד להרצה יעילה בתוכנות כמו llama.cpp, KoboldCpp או LM Studio. אין בכרטיס המקורי תוצאות מדידה או מבחנים רשמיים, והיוצר ציין רק שהם יפורסמו בהמשך, כך שאין נתון מספרי מאומת לגבי שיפור בביצועים לעומת המודלים המקוריים.

מתאים ל

  • משחקי תפקידים וכתיבה

    השילוב של Euryale נותן גמישות סגנונית וטקסט עשיר באנגלית לפרויקטים עלילתיים.

  • עוזר שיחה מקומי פרטי

    מאפשר שיחות מורכבות באנגלית ישירות מהתשתית שלכם, ללא תלות ברשת חיצונית.

  • מחקר על מיזוג מודלים

    בדיקת התנהגות של שזירת שכבות בקנה מידה של 120 מיליארד פרמטרים.

איפה זה נופל

החיסרון המרכזי הוא שמדובר במיזוג שכבות ניסיוני ולא במודל שעבר אימון סדור מקצה לקצה. כרטיס המודל לא מציג מבחני ביצועים, והשילוב בין Xwin לבין Euryale עלול להוביל לחוסר יציבות בחשיבה לוגית או בפליטת עובדות. בנוסף, המודל מוגדר עבור השפה האנגלית בלבד, ואינו כולל התאמה לעברית. גרסאות הקוונטיזציה הנמוכות, כמו Q2_K או Q3, מוגדרות על ידי TheBloke כבעלות אובדן איכות גבוה, כך שחובה לבדוק היטב את איכות הפלט לפני שמסתמכים עליו.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך המאגר?

ההמלצה בכרטיס היא לבחור בגרסת Q4_K_M ששוקלת 70.64 גיגה בייט ומספקת איזון טוב בין גודל לאיכות, או בגרסת Q5_K_M אם יש לכם מספיק זיכרון. אל תורידו את כל המאגר שמכיל מאות גיגה בייטים של קבצים כפולים.

למה קבצי Q6_K ו־Q8_0 מגיעים בשני חלקים?

האתר Hugging Face מגביל העלאת קבצים בודדים לנפח של עד 50 גיגה בייט. לכן הקבצים הגדולים פוצלו, ותצטרכו לאחד אותם לפקודה אחת במערכת ההפעלה שלכם לפני שתוכלו לטעון אותם.

האם המודל ירוץ על כרטיס מסך ביתי בודד?

לא, כרטיס ביתי ממוצע מחזיק עד 24 גיגה בייט זיכרון בלבד. המודל דורש מעל 50 גיגה בייט גם בגרסה המכווצת ביותר, כך שחובה לפצל שכבות בין כמה כרטיסים או להריץ על זיכרון המחשב.

איך מריצים

כדי להריץ מודל כזה נדרשת חומרה כבדה מאוד. הגרסה המאוזנת והמומלצת, Q4_K_M, שוקלת 70.64 גיגה בייט ודורשת לפחות 73.14 גיגה בייט של זיכרון עבודה כדי לעלות בלי כרטיס מסך, או פריסה של השכבות על פני כמה כרטיסי GPU חזקים עם זיכרון משותף תואם. קיימות גרסאות קלות יותר כמו Q2_K ששוקלת 49.63 גיגה בייט אך מגיעות עם אובדן איכות מורגש, וגרסאות כמו Q8_0 שדורשות מעל 127 גיגה בייט זיכרון ומחולקות לשני קבצים שחובה לאחד לפני ההפעלה.

אם אין לכם תחנת עבודה ייעודית מרובת כרטיסים או מק עם 128 גיגה זיכרון מאוחד, ההרצה העצמית תהיה איטית להחריד על מעבד בלבד. במצב כזה, עדיף להשתמש בפתרון ענן או בנקודת קצה מרוחקת שמחזיקה שרת מתאים במקום לנסות להרים אותו על מחשב אישי רגיל.

ollama run hf.co/TheBloke/goliath-120b-GGUF:Q2_K

הרישיון

הרישיון המדווח הוא llama2 של חברת Meta. מותר להשתמש בו לצרכים מסחריים ומחקר, אך כפוף למגבלות השימוש המקובלות של מטא, כולל תקרת משתמשים חודשיים של עד 700 מיליון ואיסור על אימון מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗