GPT
P

pdfChatter

רץ בדפדפן

bhaskartripathiafl-3.02023-03-08

  • gradio

אפשר להעלות מסמך PDF או להדביק קישור אליו, ולשאול עליו שאלות בצ'אט שמחזיר תשובות עם מספרי עמודים. זה מיועד למי שצריך לחלץ מידע ממאמרים אקדמיים וספרים בלי לקרוא הכל ידנית.

  • הורדות בחודש
  • 178לייקים

מה זה

אתם מספקים קובץ PDF בהעלאה ישירה או מזינים קישור ישיר לקובץ ברשת, מקלידים שאלה בתיבת הטקסט, ומקבלים תשובה שכוללת מראה מקום עם מספר העמוד בסוגריים מרובעים. ממשק הדוגמאות מציע קישורים למאמרים מ־arXiv ומ־Springer כדי לבדוק את המערכת מיד בלי להעלות קובץ משלכם.

מאחורי הקלעים הקוד משתמש ב־PyMuPDF לחילוץ הטקסט, ומייצר ייצוגים וקטוריים באמצעות Universal Sentence Encoder של גוגל בארכיטקטורת DAN. חיפוש הקטעים הרלוונטיים מתבצע מקומית עם NearestNeighbors מתוך scikit-learn, ואת המידע הזה התוכנה מעבירה יחד עם השאלה אל המודל של OpenAI כדי להפיק את התשובה הסופית.

מתאים ל

  • תחקור מאמרים מ־arXiv

    מדביקים קישור ישיר למאמר מדעי ושואלים על המתודולוגיה או הממצאים בלי להוריד את הקובץ.

  • איתור ציטוטים בספרים

    מעלים קובץ ארוך ומקבלים מראה מקום מדויק עם מספר העמוד שבו מופיע הנתון.

  • שליפת נתונים מדו"חות

    טוענים מסמך מרובה עמודים כדי לחלץ עובדות נקודתיות בלי לעבור על כל הטקסט ידנית.

איפה זה נופל

היישום לא עובד בלי שתספקו מפתח API פרטי שלכם מ־OpenAI, כך שזה לא כלי עצמאי שפשוט נכנסים אליו ומריצים. בנוסף, חילוץ הטקסט נשען על פירוק רגיל מ־PDF, כך שאם המסמך שלכם סרוק כתמונה וללא שכבת טקסט, המודל לא ימצא בו כלום. הדיוק במיקום המידע מוגבל לחלוקת הפסקאות והעמודים שנקלטו.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

הממשק עצמו פתוח ללא תשלום, אך הוא דורש מפתח API אישי של OpenAI. המשמעות היא שכל שאלה שתשאלו תגרור חיוב בחשבון ה־OpenAI שלכם. ללא הזנת מפתח פעיל עם יתרה, לא תוכלו לקבל תשובות.

מה קורה עם הקבצים ומפתח ה־API שלי?

הקובץ מעובד על השרת שמריץ את המופע לצורך חילוץ הטקסט והווקטורים. קטעי המידע שנמצאו רלוונטיים, יחד עם המפתח שלכם, נשלחים אל OpenAI לצורך יצירת התשובה. שום דבר מזה לא נשמר במאגר ציבורי קבוע, אך הנתונים עוברים בצד השרת.

כמה זמן לוקח לקבל תשובה?

העיבוד הראשוני של מסמך ארוך עשוי לקחת כמה עשרות שניות בגלל הריצה על מעבד בסיסי. לאחר שהטקסט נקלט, השאילתות תלויות בעיקר במהירות התגובה של שרתי OpenAI. מסמכים קצרים מגיבים מהר יותר מקבצים של מאות עמודים.

במה זה שונה משימוש רגיל במודל של OpenAI?

במקום להדביק טקסט ישירות לצ'אט ולהיתקל במגבלת מקום, כאן נעשה חיפוש מוקדם בעזרת מודל ההטמעות של גוגל. המערכת שולפת רק את הפסקאות הרלוונטיות ומצמידה אליהן את מספר העמוד המקורי. זה עוזר לוודא מאיפה המידע הגיע במקום להסתמך על זיכרון המודל בלבד.

איך משתמשים

פותחים את הממשק בדפדפן, מזינים מפתח API אישי של OpenAI, ומעלים קובץ PDF או מדביקים קישור. לאחר מכן כותבים את השאלה ולוחצים על Submit. התוכנה רצה על מעבד בסיסי, מה שאומר ששלב ההטמעה וחישוב השכנים למסמכים ארוכים ייקח זמן עוד לפני שהשאילתה נשלחת ל־OpenAI.

הרישיון

הקוד מפורסם תחת רישיון afl-3.0 שמאפשר שימוש והתאמה, אך השימוש מחייב מסירת מפתח OpenAI פרטי. המידע שתעלו והשאלות שתשאלו נשלחים ישירות לשרתי OpenAI בהתאם למדיניות השימוש שלהם.

הרישיון המלא ב־Hugging Face ↗