GPT
W

WhiteRabbitNeo-13B-GGUF

קוד פתוח

TheBlokellama22023-12-21

  • transformers
  • gguf
  • llama

גרסת GGUF מכווצת למודל של WhiteRabbitNeo עם 13 מיליארד פרמטרים. היא נועדה להרצה מקומית על מחשבים אישיים או שרתים קטנים באמצעות ספריות כמו llama.cpp.

  • 91.9 GBמשקל הקבצים
  • 7,979הורדות בחודש
  • 65לייקים

מה זה

המאגר הזה מציע המרות שונות של המודל WhiteRabbitNeo 13B לפורמט GGUF, שפותח במיוחד כדי לייעל ריצה על מעבדים וכרטיסים גרפיים ביתיים. TheBloke יצר כאן סדרה של קבצים מכווצים בשיטות שונות, החל מכיבוץ כבד של שתי ביט ועד שמונה ביט, כך שאפשר להתאים את הקובץ המדויק לפי המגבלות של המכונה שלכם.

בניגוד לקובץ המקורי שמגיע בפורמט הרגיל של transformers ושוקל הרבה יותר, הפורמט הזה מאפשר להריץ מודל של 13 מיליארד פרמטרים כמעט על כל כלי מקומי מוכר, כמו LM Studio או text-generation-webui, בלי להסתבך עם סביבות פיתוח כבדות.

מתאים ל

  • עבודה מקומית ללא ענן

    מאפשר לשלוח בקשות ולקבל תשובות באופן מקומי לגמרי דרך llama.cpp, בלי שמידע יוצא מהמחשב.

  • פיתוח אפליקציות עם ממשק תואם

    מתחבר ישירות לספריות פייתון כמו llama-cpp-python כדי להרים שרת מקומי שמתחזה לממשק של OpenAI.

  • הפעלה על לפטופים עם מעבד בלבד

    גרסאות ה־4 ביט מאפשרות להריץ מודל 13B על מחשב נייד מודרני בלי צורך בכרטיס מסך ייעודי של אנבידיה.

איפה זה נופל

הכרטיס מבהיר במפורש שהגרסאות המכווצות ביותר, כמו Q2_K ו־Q3_K, מציגות ירידה מהותית באיכות התשובות, כך שלא כדאי לבנות עליהן לשום משימה שדורשת הבנה מורכבת. מעבר לזה, אין בדף נתוני מבחנים רשמיים, השוואות ביצועים או פירוט על סט האימון של WhiteRabbitNeo עצמו, כך שאי אפשר לדעת מראש איך הוא מתפקד בעברית או במשימות קוד מבלי לבדוק אותו ישירות.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך כל הרשימה?

מורידים רק קובץ אחד, לא את כל המאגר. ההמלצה של TheBloke לרוב המשתמשים היא whiterabbitneo-13b.Q4_K_M.gguf, ששומר על פשרה טובה בין גודל של פחות מ־8 גיגה בייט לבין שמירה על איכות המודל המקורית.

כמה זיכרון מחשב צריך בשביל להריץ אותו בלי כרטיס מסך?

אם מריצים על המעבד בלבד בלי GPU, גרסת Q4_K_M דורשת לפחות 10.37 גיגה בייט של זיכרון RAM פנוי. עבור הגרסאות הקלות ביותר כמו Q2_K תצטרכו סביב 8 גיגה בייט, ועבור גרסאות ה־8 ביט הכבדות תצטרכו מעל 16 גיגה בייט.

אפשר להשתמש בספריית ctransformers הישנה כדי להריץ את זה?

עדיף שלא. בדף המודל מצוין במפורש ש־ctransformers כבר לא מתוחזקת מספיק זמן ועלולה לא לתמוך במודלים עדכניים, ולכן עדיף להשתמש ב־llama-cpp-python או ישירות ב־llama.cpp.

איך מריצים

טוענים קובץ בודד מתוך הרשימה, לפי כמות הזיכרון שיש לכם. הגרסה המאוזנת והמומלצת לרוב האנשים היא Q4_K_M, שדורשת קובץ של 7.87 גיגה בייט וכעשרה וחצי גיגה בייט זיכרון עבודה כדי לרוץ על המעבד בלבד. אם יש לכם כרטיס מסך עם מספיק זיכרון וידאו, אפשר להעביר אליו שכבות כדי לקבל קצב תגובה מהיר בהרבה.

גרסאות הקידוד הנמוכות כמו Q2_K אמנם שוקלות רק 5.43 גיגה בייט, אבל הן מגיעות עם פגיעה מורגשת באיכות הפלט. מי שצריך דיוק גבוה יותר יכול ללכת על Q5_K_M שדורש סביב 12 גיגה בייט זיכרון, אבל אם אין לכם לפחות 16 גיגה בייט של זיכרון מערכת פנוי, עדיף להשתמש בשרת מרוחק.

ollama run hf.co/TheBloke/WhiteRabbitNeo-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון llama2 של מטא. הרישיון הזה מתיר שימוש מסחרי ומחקר, אבל הוא כולל מגבלות ספציפיות, כולל איסור על שימוש בפלטים שלו כדי לאמן מודלים מתחרים, ותנאי רישוי מיוחדים אם המוצר שלכם מגיע ליותר מ־700 מיליון משתמשים פעילים בחודש.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗