GPT
L

Llama-3.1-Nemotron-70B-Instruct-HF-GGUF

קוד פתוח

bartowskillama3.12024-10-15

  • gguf
  • nvidia
  • llama3.1
  • text-generation
  • en

גרסת קוונטיזציה של מודל ההוראות מבית אנבידיה על בסיס לאמה 70B, המיועדת להרצה מקומית. הוא פונה למי שמחפש יכולות ניסוח ותשובה חזקות באנגלית בלי להחזיק שרתי ענק.

  • 765 GBמשקל הקבצים
  • 2,943הורדות בחודש
  • 108לייקים

מה זה

מדובר בהמרה של הדגם המקורי של אנבידיה לפורמט GGUF באמצעות llama.cpp, שביצע המשתמש bartowski. הבסיס הוא ארכיטקטורת 70B שעברה כוונון ייעודי למענה על שאלות והנחיות מורכבות, וכאן היא נארזה בעשרות רמות דחיסה שונות עם כיול מבוסס imatrix.

הדגמים בעמוד הזה נותנים פתרון למי שרוצה להריץ דגם של שבעים מיליארד פרמטרים על חומרה מקומית או ביתית חזקה. במקום לקבל קבצים גולמיים של חצי טרה, יש כאן משקלים שמתחילים מאיכות מקסימלית ויורדים עד רמות דחיסה אגרסיביות מאוד ששוקלות פחות מעשרים גיגה בייט.

מתאים ל

  • מענה מורכב להנחיות באנגלית

    כוונון ההוראות של אנבידיה מספק תשובות מפורטות ומובנות במיוחד עבור פרומפטים מסובכים.

  • פיתוח מקומי מאובטח

    הרצה מקומית על תחנת עבודה חזקה של 70B בלי להוציא נתונים רגישים מחוץ לרשת.

  • ניסויי קוונטיזציה בחומרה מוגבלת

    מגוון המשקלים מאפשר לבדוק את הגבול התחתון של פגיעה באיכות מול צריכת הזיכרון.

איפה זה נופל

הקובץ מוגדר לאנגלית בלבד, ואין שום תיעוד או התחייבות לתמיכה בעברית או בשפות אחרות. מעבר לזה, רמות הדחיסה הנמוכות כמו IQ1_M או סדרת Q2 מגיעות עם ירידה מורגשת בדיוק ובאיכות הפלט, והמפתח בעצמו מזהיר שלא להשתמש בגרסאות הדחוסות ביותר. חובה לבדוק איכות מענה על משימות ספציפיות לפני שסומכים עליו.

שאלות
נפוצות

איזה קובץ להוריד מתוך כל הרשימה?

לרוב המשתמשים כדאי לקחת את Q4_K_M שמאזן בין גודל של ארבעים ושניים גיגה לאיבוד איכות מינימלי. אם יש לכם מחסור בזיכרון, אפשר לנסות את גרסאות ה־IQ3, אבל מתחת לזה יש פגיעה ממשית ביכולת המודל.

האם הוא יעבוד טוב בעברית?

כרטיס המודל מגדיר את השפה כאנגלית בלבד. מודלים כאלה יודעים לעיתים לפלוט עברית בסיסית בגלל המידע ברשת, אבל לא הייתי בונה עליו ליישום עסקי בשפה הזו בלי בדיקה מעמיקה.

למה חלק מהקבצים מחולקים לכמה חלקים?

גרסאות באיכות גבוהה כמו Q8_0 שוקלות קרוב לשבעים וחמישה גיגה בייט ועוברות את מגבלת הגודל לקובץ בודד. במקרים האלה צריך להוריד את כל חלקי התיקייה באמצעות כלי ההורדה של האגינג פייס כדי שהתוכנה תאחד אותם.

איך מריצים

כדי להריץ אותו צריך תוכנות כמו LM Studio או llama.cpp ישירות. גרסת ברירת המחדל המאוזנת, Q4_K_M, שוקלת כארבעים ושניים גיגה בייט ומחייבת לפחות שני כרטיסי מסך חזקים עם זיכרון כולל של ארבעים ושמונה גיגה כדי לרוץ במהירות סבירה.

אפשר גם לערבב זיכרון מערכת עם זיכרון גרפי, אבל הקצב ייפול משמעותית. אם אין לכם לפחות שישים וארבעה גיגה בייט של זיכרון מהיר או כרטיסים ייעודיים, כל ניסיון הרצה יהיה איטי להחריד, ועדיף להשתמש בשירות ענן שמציע את המודל הזה דרך שורת קוד אחת.

ollama run hf.co/bartowski/Llama-3.1-Nemotron-70B-Instruct-HF-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 765 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון llama3.1 המקורי של מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות של מטא, כולל תנאי שימוש חודשיים למערכות גדולות והגבלות על אימון מודלים מתחרים ישירות מהפלטים שלו.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗