GPT
U

Unlimited-OCR-GGUF

קוד פתוח

sahilchachramit2026-06-23

  • gguf
  • llama.cpp
  • deepseek-ocr
  • ocr
  • vision-language

גרסת GGUF למודל OCR קומפקטי בגודל 3B שמיועד לפענוח מסמכים ארוכים ישירות לפורמט מרקדאון. הוא מחזיר תיבות מיקום סביב הטקסט ויכול לרוץ מקומית בלי חומרה יקרה.

  • 27.4 GBמשקל הקבצים
  • 16,676הורדות בחודש
  • 140לייקים

מה זה

מדובר בהמרה של baidu/Unlimited-OCR לפורמט GGUF שמריצים דרך llama.cpp. המודל בנוי בארכיטקטורה של DeepSeek-OCR, שמשלבת מגדל ראייה מסוג DeepEncoder המורכב מ־SAM ומ־CLIP יחד עם מפענח טקסט של DeepSeek-V2 בשיטת תערובת מומחים. גודל המודל הוא 3 מיליארד פרמטרים, והוא תוכנן לפענוח מסמכים מלא ומורכב במעבר אחד.

הוא לא מסתפק בחילוץ מחרוזות גולמיות אלא יודע לשמור על מבנה של כותרות וטבלאות, להחזיר קואורדינטות של תיבות תוחמות עבור כל קטע שזוהה, ולנתח תרשימים וגרפים. בריפו הזה מקבלים גרסאות מכווצות מגוונות יחד עם קובץ מקרן הראייה שדרוש לטעינת התמונות.

מתאים ל

  • המרת חשבוניות למרקדאון

    שליפת נתונים מטפסים וחשבוניות תוך שמירה על מבנה הטבלאות ומבלי לשלוח מידע פיננסי לענן.

  • איתור שדות בטפסים סרוקים

    קבלת קואורדינטות ותיבות תוחמות סביב מחרוזות ספציפיות כדי לסמן אותן בממשק משתמש.

  • חילוץ נתונים מגרפים ותרשימים

    פענוח של דיאגרמות ותרשימים טכניים ישירות לפורמט טקסטואלי מובנה.

איפה זה נופל

החיסרון הבולט הוא התלות בגרסה לא ממוזגת של llama.cpp, מה שהופך את התחזוקה בייצור למסורבלת. בנוסף, בעמוד מציינים מפורשות שהגרסאות המכווצות הנמוכות מאוד, כמו IQ3_XXS או IQ2_M, סובלות מאובדן דיוק מורגש ולא מתאימות לעבודה אמיתית.

במסמכים צפופים המודל עלול להיכנס ללולאות של טקסט שחוזר על עצמו, מה שמחייב הגדרה ידנית של repetition penalty בהרצה. עבור מסמכים מרובי עמודים הוא לא רץ במכה אחת אלא דורש פירוק עמוד-עמוד והדבקה ידנית של התוצאות.

שאלות
נפוצות

אפשר פשוט להוריד ולהריץ את זה ב־llama.cpp הרגיל שיש לי במחשב?

לא. הארכיטקטורה של DeepSeek-OCR עדיין לא נכנסה לענף הראשי של llama.cpp, ולכן הגרסה הרגילה לא תזהה את הקבצים. חייבים למשוך ולקמפל את הענף הספציפי מתוך ה־PR שמטפל במודל הזה.

איזו גרסת קוונטיזציה כדאי להוריד מתוך הרשימה?

הגרסה המאוזנת והמומלצת היא Q4_K_M ששוקלת 1.82 גיגה-בייט ומספקת שילוב טוב בין דיוק לגודל זיכרון. אם יש לכם שפע זיכרון אפשר לקחת את Q8_0, אבל אל תרדו מתחת ל־4 ביט כי איכות זיהוי הטקסט נפגעת שם בצורה ברורה.

איך מריצים

בשביל להריץ אותו צריך להוריד שני קבצים נפרדים: קובץ משקלים של מודל השפה וקובץ מקרן הראייה ששוקל 774.27 מגה-בייט ורץ תמיד בפורמט F16. גרסת הבסיס המומלצת היא Q4_K_M ששוקלת 1.82 גיגה-בייט, מה שאומר שכל העסק נכנס בקלות לתוך כרטיס מסך ביתי בסיסי עם 6 או 8 גיגה-בייט של זיכרון, ואפילו לרוץ על מעבד רגיל דרך RAM.

העניין העיקרי כאן הוא ההרצה עצמה. אי אפשר להשתמש בגרסה הרשמית של llama.cpp כי התמיכה בארכיטקטורה הזו טרם מוזגה לקוד הראשי. צריך לקמפל ידנית את ענף ה־Pull Request הספציפי (מספר 17400 או 24975 כפי שמצוין בפקודות הבנייה).

ollama run hf.co/sahilchachra/Unlimited-OCR-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל והמשקלים מופצים תחת רישיון MIT, בדיוק כמו מודל המקור של baidu שעליו הוא נשען. זה רישיון פתוח לחלוטין שמאפשר שימוש מסחרי, שינוי קוד, הפצה ושילוב בתוך מוצרים סגורים בלי דרישה לפתוח את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗