API לקבלת רשימת דפים וסימנים בספרי היסוד התורניים
-
לצורך אפליקצייה מסויימת שאני בונה אני צריך רשימה של מספר הפרקים / דפים / סימנים בספרי היסוד התורניים.
האם יש API דרכו ניתן לבצע זאת? הבנתי שניתן לעשות זאת עם ה-API של ספריא, אבל בפועל לא ממש הסתדרתי עם זה
-
אפשר לעשות זאת עם סקריפט בדומה למה שהראיתי (וגם @צדיק-תמים) פה:
https://tchumim.com/topic/15896/בקשה-רשימת-דפים-סימנים-שמתחילים-בהם-פרקים-נושאים-בשס-טושעאולי זה עבודה אבל זה גם כיף :).
-
לצורך אפליקצייה מסויימת שאני בונה אני צריך רשימה של מספר הפרקים / דפים / סימנים בספרי היסוד התורניים.
האם יש API דרכו ניתן לבצע זאת? הבנתי שניתן לעשות זאת עם ה-API של ספריא, אבל בפועל לא ממש הסתדרתי עם זה
@NH-LOCAL
https://github.com/lisrael1/bavli_pages
זה לש"ס, לשאר הספרים אם יש לך את אוצריא אתה יכול פשוט לשאוב משם את הנתונים לפי רמות הכותרות. -
@NH-LOCAL
למה?, סקריפט מאוד פשוטfrom bs4 import BeautifulSoup def get_toc(file_path, level = 2): with open(file_path, "r", encoding="utf-8") as f: content = f.read() soup = BeautifulSoup(content, "html.parser") list_all = list(tag.string for tag in soup.find_all(f"h{level}")) return list_allאגב אתה יכול להשתמש גם בapi של מדיה ויקי, משהו בסגנון הזה:
def get_list_by_category(category: str)->list: """מחזיר רשימת דפים שנמצאים בקטגוריה מסוימת.""" i = 0 pages = [] cmcontinue = '' while True: i += 1 params = { 'action': 'query', 'list': 'categorymembers', 'cmtitle': category, 'cmtype': 'page', 'cmlimit': 'max', 'format': 'json', 'cmcontinue': cmcontinue } response = requests.get(BASE_URL, params=params) data = response.json() if 'query' in data and 'categorymembers' in data['query']: pages.extend([page["title"] for page in data['query']['categorymembers']]) else: print("Error fetching pages:", data) break if 'continue' not in data: break cmcontinue = data['continue']['cmcontinue'] print(f"Fetching pages: batch {i}") return pages -
הבעיה באוצריא שיש חוסר עקביות ברמת הכותרות. למשל, שמתי לב שהסימנים בשולחן ערוך מוגדרים כ-H2, אבל באבן העזר הם מוגדרים כ-H3, מה שיצר טעות בזיהוי המספר (השתמשתי בניתוח פשוט של קבצי הטקסט, לא עם bsoup)
@NH-LOCAL
כדי להתגבר על חוסר העקביות ברמות הכותרות, אפשר להשתמש במבנה היררכי, כמו Stack, כדי לעקוב אחר ה-parent האחרון. כך ניתן לתקן את רמת הכותרת בהתאם להקשר ולהבטיח זיהוי נכון של המספרים והכותרות. -
למי שיראה את השרשור הזה, ניתן לקבל נתוני פרקים ואורך של ספרי יסוד במערך הנתונים שפרסמתי ב-HF
https://huggingface.co/datasets/NHLOCAL/judaic-texts-structure
-
למי שיראה את השרשור הזה, ניתן לקבל נתוני פרקים ואורך של ספרי יסוד במערך הנתונים שפרסמתי ב-HF
https://huggingface.co/datasets/NHLOCAL/judaic-texts-structure
@NH.LOCAL
ואוו בדיוק הייתי צריך את זה היום
השגחה פרטית! -
מעניין @NH.LOCAL כי בדיוק פרסמתי במתמחים אפליקציה דומה שבניתי.
(אולי יש פה תחרות
. )אז יש לי את המידע לרוב. תגיד אם אתה צריך משהו/ספר ספיציפי
@mendel כתב בAPI לקבלת רשימת דפים וסימנים בספרי היסוד התורניים:
מעניין @NH.LOCAL כי בדיוק פרסמתי במתמחים אפליקציה דומה שבניתי.
(אולי יש פה תחרות
. )אז יש לי את המידע לרוב. תגיד אם אתה צריך משהו/ספר ספיציפי
אדרבה. תחרות זה מצוין. (בטח במשהו שגם ככה לא נוצר למטרות רווח
)
אם יש לך את הנתונים בצורה מסודרת, אולי כדאי שתפרסם אותם איפשהו כקוד פתוח, ב-HF או בגיטהאבאם כי למעשה את אפליקציית שמור וזכור יצרתי כבר לפני קרוב לשנה
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות