GPT
R

RekaAI_reka-flash-3-GGUF

קוד פתוח

bartowskiapache-2.02025-03-11

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת למודל של חברת RekaAI, שנועדה לאפשר הרצה מקומית יעילה על גבי llama.cpp או LM Studio בלי תלות בשרת חיצוני.

  • 335 GBמשקל הקבצים
  • 2,637הורדות בחודש
  • 46לייקים

מה זה

מדובר בהמרה של reka-flash-3 לפורמט GGUF בעזרת llama.cpp גרסה b4867, שבוצעה על ידי bartowski. המודל מתמקד במשימות יצירת טקסט ושיחה, ומגיע במגוון רחב מאוד של רמות דיוק, החל ממשקל מלא של 41.82 ג'יגה בייט בפורמט bf16 ועד לכיווצים קיצוניים של 7.39 ג'יגה בייט בפורמט IQ2_XXS.

כל הקבצים כאן נוצרו בעזרת כיול imatrix עם דאטהסט ייעודי, כדי למנוע הידרדרות חדה באיכות התוכן בעת הדחיסה. חלק מהגרסאות, כמו Q6_K_L או Q4_K_L, משמרות את משקלי ה־embed וה־output ברמת Q8_0, מה שמשפר את יציבות הפלט במחיר קטן של זיכרון. תבנית הפרומפט שנקבעה למודל מוגדרת במבנה של human מול assistant עם מפריד ספציפי, ולפי התיעוד תוקן בה מנגנון ה־chat template כדי למנוע תקלות תקשורת שוטפות.

מתאים ל

  • סוכן שיחה מקומי

    הרצה מקומית על גבי LM Studio בלי חיבור רשת חיצוני, תוך שימוש בתבנית השיחה המובנית של המודל.

  • עיבוד טקסט על חומרת צרכנים

    גרסת Q4_K_M מתאימה בדיוק לכרטיסי מסך עם 16GB זיכרון ומאפשרת מענה מהיר ליצירת טקסט.

  • אינפרנס על מעבדי ARM

    שימוש בגרסאות Q4_0 או IQ4_NL שנהנות מטעינה מחדש של משקלים בזיכרון לייעול מהירות העיבוד.

איפה זה נופל

הכרטיס לא מציג שום מידע על נתוני האימון המקוריים, ביצועים אמפיריים במבחנים מקובלים, או תמיכה בשפות שאינן אנגלית, ולכן התנהגות המודל בעברית אינה מובטחת ודורשת בדיקה עצמאית. בנוסף, גרסאות הכיווץ הנמוכות מתחת ל־Q3 מוגדרות על ידי היוצר עצמו כבעלות איכות ירודה, כך שהן עלולות לפלוט הזיות ולשבש פקודות מורכבות.

שאלות
נפוצות

איזה קובץ ספציפי הכי כדאי להוריד?

ברירת המחדל המומלצת היא Q4_K_M ששוקל 13.61 ג'יגה בייט ומאזן בין איכות טובה לדרישות זיכרון סבירות. אם יש לכם מספיק מקום בכרטיס המסך ואתם מחפשים דיוק מקסימלי, עדיף לבחור ב־Q6_K ששוקל 18.44 ג'יגה בייט.

איך צריך לבנות את הפרומפט כדי שהמודל יגיב נכון?

יש להקפיד על המבנה המוגדר בכרטיס: human: {system_prompt} {prompt} <sep> assistant:. סטייה מהמבנה הזה או השמטה של התגית <sep> עלולה לשבש את פעולת המודל ולגרום לו להמשיך את הטקסט בצורה לא עקבית.

איך מריצים

ההרצה נעשית ישירות דרך llama.cpp או באמצעות ממשק כמו LM Studio. כדי לבחור קובץ מתאים, יש לחשב את נפח ה־VRAM בכרטיס המסך, מומלץ לקחת קובץ שקטן ב־1 עד 2 ג'יגה בייט מסך הזיכרון הזמין כדי להכניס את כל המשקלים לכרטיס. הגרסה המאוזנת והמומלצת לרוב המשתמשים היא Q4_K_M ששוקלת 13.61 ג'יגה בייט, ודורשת מעבד גרפי עם 16 ג'יגה בייט זיכרון לפחות.

אם יש לכם כרטיס חלש יותר, קיימים קובצי I-quants קטנים עד 8 ג'יגה בייט, אבל הם דורשים תמיכה ב־cuBLAS או rocBLAS ולא יעבדו היטב על Vulkan. אם אין לכם חומרה ייעודית עם זיכרון מהיר, עדיף להשתמש ב־API מרוחק במקום לנסות להריץ גרסאות של 2 ביט על ה־CPU בקצב אטי.

ollama run hf.co/bartowski/RekaAI_reka-flash-3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים פרטיים או מסחריים, כל עוד שומרים על הודעת זכויות היוצרים המקורית ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗