{"as_of":"2026-08-08T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee21c2386c339a2310feffafaf2449a9fd9b6709bb0be6a091d6296fb55c448e","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:34.249618Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:30:31.083510Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:30:34.809388Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"cited_work":{"arxiv_id":"2505.24371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24371","snapshot_observed_at":"2026-08-07T12:30:34.809388Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","venue":"cs.CV","work_id":"d3b23750-4178-4a97-af9a-c5e6591f7f4c","year":2025},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.083510Z"},"links":{"cited_paper":"/paper/2505.24371","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:9f5754cadea630f22c7886696af61384641c90da6745215564f140a6e2a3a11a","observation_id":"c65a519e-1029-4de4-bda0-8b02e1b64b5a","resolution":{"observed_at":"2026-08-07T12:30:34.865426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24371/citation-record","integrity":"/paper/2505.24371/integrity","json":"/paper/2505.24371/citation-record.json","paper":"/paper/2505.24371"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"cited_work":{"arxiv_id":"2505.24371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24371","snapshot_observed_at":"2026-08-07T12:30:34.809388Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","venue":"cs.CV","work_id":"d3b23750-4178-4a97-af9a-c5e6591f7f4c","year":2025},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.083510Z"},"links":{"cited_paper":"/paper/2505.24371","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:9f5754cadea630f22c7886696af61384641c90da6745215564f140a6e2a3a11a","observation_id":"c65a519e-1029-4de4-bda0-8b02e1b64b5a","resolution":{"observed_at":"2026-08-07T12:30:34.865426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:38.342614Z","title":"Further research [5] extends the image VLM to support multi-frame and video data modalities","venue":null,"work_id":"2010edb7-32e8-4984-984b-47030886632c","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.146651Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:ce5bd489e045bf7bacbfb1cc354cabd681850e0e0e55a96848c388da93273cdf","observation_id":"352a4101-0848-419e-83ce-c1e6b08b7fb8","resolution":{"observed_at":"2026-08-07T12:30:38.424721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:38.231147Z","title":"The first phase is the tran- scription generation phase","venue":null,"work_id":"8fd16214-6667-4e84-aad8-a285c4652a50","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.239277Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:2f0259746ad46e14605764714c3fca40cea22c4d838501286b90ee913c1ddc6c","observation_id":"d97db90e-1f28-4999-8b0c-b3b39bbfd3d3","resolution":{"observed_at":"2026-08-07T12:30:38.266635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:38.112273Z","title":"Baseline models We leveraged the LLaV A-1.6-7B VLM [23] to generate local and global transcriptions and the Llama-3.1-8B LLM [24] for the VideoQA task","venue":null,"work_id":"5864a769-dd87-4168-afc5-4ef76ff9cd78","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.336355Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:d0db92b97587b57eb60cd027d8c257b2b510d65fca3daeccb130bbcd76778a8c","observation_id":"74f755b7-84d5-41e9-a367-80dcf7a6f2de","resolution":{"observed_at":"2026-08-07T12:30:38.179602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.974737Z","title":"The system is inherently modular and built on open-source VLM and LLM","venue":null,"work_id":"06937cd8-e461-4c66-aa42-888fda7da8e2","year":null},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.423370Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:33460eaad82c3ab577caa038542d1b4210013089d08916c3b4b825cb5ad4a7aa","observation_id":"797c5fb9-80c5-4173-a6bf-a4b17cc92020","resolution":{"observed_at":"2026-08-07T12:30:38.058928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.766597Z","title":"MOKA: Open- vocabulary robotic manipulation through mark-based visual prompting,","venue":null,"work_id":"9717f556-4884-42e1-8f37-c0cc3f5ba6c3","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.499625Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:8bedd1e8597a8fdba88881f8608a4b2845c5167dcc2b77b3640776176811aa47","observation_id":"53e15e52-b447-4329-b1ab-f728b312f753","resolution":{"observed_at":"2026-08-07T12:30:37.875398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.597565Z","title":"VLAAD: Vision and language assistant for au- tonomous driving,","venue":null,"work_id":"bb57e8ca-4aaf-41dd-a39e-9e5c2722363b","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.568370Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:3f220b684ef75170cd86acdcc9206206b03dd5c2090a0da2c3c403534d16f4bf","observation_id":"382d85ff-e26b-49d7-9343-02f316d43980","resolution":{"observed_at":"2026-08-07T12:30:37.669183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.418577Z","title":"Smart customer service in unmanned retail store enhanced by large language model,","venue":null,"work_id":"0e0b1aff-90aa-4668-b6da-c50a46b8cf93","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.641448Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:61fbba9ab66e8f9aa47118d6daf15e94c3482694f9dbecae6a75b0fdae867d2f","observation_id":"59c1cdc9-db3a-4ac2-9831-49adbccd3cbe","resolution":{"observed_at":"2026-08-07T12:30:37.490277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:30:31.714734Z","title":"Qwen2-VL: Enhancing vision- language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.714734Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:770203b634982f67ba3094ac2a3461b9fd38a4f7cf84aa90c42a7da013347b09","observation_id":"c0d8171a-5c54-4539-9534-0024ca4953cf","resolution":{"observed_at":"2026-08-07T12:30:31.714734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.238600Z","title":"LLaV A-OneVision: Easy visual task transfer,","venue":null,"work_id":"4d79a1bd-eccf-47a4-bc04-deec321624dc","year":2025},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.782618Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:7e4880a232db264860ed6d1447fb5b73319e57fa2d9fd1eae39289f87eb9f41c","observation_id":"0b8ea0af-1122-47fb-9588-f63d5c0fe1f3","resolution":{"observed_at":"2026-08-07T12:30:37.325359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T12:30:31.859767Z","title":"VideoChat: Chat-centric video under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.859767Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:305945a978cdda86ccbc88e37ab8c35c793123918b91dac0a28eb6f4668bcf9e","observation_id":"ac08881b-48a1-4659-a175-f4a53b64c0d8","resolution":{"observed_at":"2026-08-07T12:30:31.859767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:37.105480Z","title":"A simple LLM framework for long- range video question-answering,","venue":null,"work_id":"998a6db2-f232-4961-9194-23e694691439","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:31.933492Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:a0497a0b7e702ebce2a3b8a38a973c7bfe28d516efc281595e620fa4ec654153","observation_id":"31d3d6c0-03e8-4cb2-803f-7631c67d5c9d","resolution":{"observed_at":"2026-08-07T12:30:37.158371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:30:32.012193Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.012193Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:b3e0da21330d3bf4046a3ea4c2825b4d84df7734fa2fe19426ca7e8ce941a643","observation_id":"0c71c004-3791-4536-a46f-72046256c69e","resolution":{"observed_at":"2026-08-07T12:30:32.012193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:30:32.096412Z","title":"Gem- ini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.096412Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:20a174cd358acf773414e078fdd0d603e92e07751e2198c81e9e39ba449318f7","observation_id":"cbe3c9c6-fc2b-408d-bb41-042cbc11112f","resolution":{"observed_at":"2026-08-07T12:30:32.096412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:32.202556Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.202556Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:632476ab0268c277056842397dd1f316d1a07a2fa24f711310e711474702fc4c","observation_id":"5d6d3dc4-2dc4-41f1-ac3d-f8b7950efd09","resolution":{"observed_at":"2026-08-07T12:30:32.202556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.855197Z","title":"An image grid can be worth a video: Zero-shot video question answering using a vlm,","venue":null,"work_id":"edd7587e-6922-49a9-b208-4572bc9c291b","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.275288Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:a3eddfcd2c5763f1c9f25a88fd51483eccaf8b12d480187eb4c80a289f4cfc0c","observation_id":"c49c3092-be31-4fe1-936b-8c2c65624229","resolution":{"observed_at":"2026-08-07T12:30:36.936620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.697596Z","title":"Self-chained image- language model for video localization and question answer- ing,","venue":null,"work_id":"e9190a6c-b1f9-4e84-95e5-16ded028b644","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.380318Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:6070720c61f8deb84249c6e8f45f0664b9c7073fa1534e61e6a9326268626bb8","observation_id":"c0414aa9-916d-4f00-9240-84c5999a2165","resolution":{"observed_at":"2026-08-07T12:30:36.788952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T12:30:32.456684Z","title":"Set-of- mark prompting unleashes extraordinary visual grounding in gpt-4v,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.456684Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:103c1891bba2730391aa17f391c53d1f83c6e50c965ba405665270fc99c976e0","observation_id":"3768e06e-5716-4740-8abc-34f9f9b9459e","resolution":{"observed_at":"2026-08-07T12:30:32.456684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.525521Z","title":"GeoChat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":"8f83bac2-36ca-46db-bc87-fbb097d6793d","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.558947Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:7aeb36cc5febe543f1372c7562408edd3c5d31b0daec119afc68fadfbddf60fa","observation_id":"b2e5dfae-a11a-49e4-bcbc-1eedfffda2b2","resolution":{"observed_at":"2026-08-07T12:30:36.594439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13596","last_updated":"2024-11-29T10:18:58Z","snapshot_observed_at":"2026-08-08T11:55:45.577205Z","submitted_at":"2024-07-18T15:35:00Z","title":"EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13596","snapshot_observed_at":"2026-08-07T12:30:32.685636Z","title":"Earth- Marker: A visual prompt learning framework for region-level and point-level remote sensing imagery comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.685636Z"},"links":{"cited_paper":"/paper/2407.13596","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:e978c3162de4b3c3e0e504c8b94d30943a4d01186d56709fd9562e5b46cc2523","observation_id":"21b7a483-93aa-4aa1-8821-9ec4b97b7df8","resolution":{"observed_at":"2026-08-07T12:30:32.685636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.282279Z","title":"PIVOT: iterative visual prompting elicits actionable knowl- edge for vlms,","venue":null,"work_id":"64073b7b-fa19-43af-9bff-dac2ac482275","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.807866Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:23708285117aaa067949eca52f67d0a8342e7bf998eb5585acf8b9a036ade4fd","observation_id":"609b1966-0f06-4ac3-8f54-bb72cfdb3bb7","resolution":{"observed_at":"2026-08-07T12:30:36.385702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17422","last_updated":"2025-04-07T10:55:13Z","snapshot_observed_at":"2026-08-07T08:15:28.289417Z","submitted_at":"2024-08-30T17:12:14Z","title":"Open-Vocabulary Action Localization with Iterative Visual Prompting","version":5},"cited_work":{"arxiv_id":"2408.17422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.17422","snapshot_observed_at":"2026-08-07T12:30:34.517356Z","title":"Open-Vocabulary Action Localization with Iterative Visual Prompting","venue":"cs.CV","work_id":"8445e23f-09f3-4155-b6e5-51f3511c393d","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:32.904432Z"},"links":{"cited_paper":"/paper/2408.17422","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:8872a8f145909377c4dc155bc0a9889455d0602967df7e939c0af7df939f6d2d","observation_id":"4190cbcb-4f1e-4621-a6e7-d0333ec88c03","resolution":{"observed_at":"2026-08-07T12:30:34.604723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:36.082332Z","title":"Video graph trans- former for video question answering,","venue":null,"work_id":"8d3ef1ea-37f5-4719-94aa-50d1cd6473e7","year":2022},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.038946Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:453ea47213b847b0e04653710b7db5e7d37623f4073099c19c8ca1ce634b7f43","observation_id":"2579bd6f-136b-45e3-97c8-57fd2d7e1a2c","resolution":{"observed_at":"2026-08-07T12:30:36.199823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T12:30:33.191576Z","title":"InternVideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.191576Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:fbdb79dd1310d23e07ad439291be8667c906cc66563796510c54cb8f4ee21355","observation_id":"a19f1bcc-2c7e-4e11-9527-3b1c0426aa55","resolution":{"observed_at":"2026-08-07T12:30:33.191576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.872598Z","title":"MVBench: A comprehensive multi- modal video understanding benchmark,","venue":null,"work_id":"f5b0415c-f150-4843-9093-7ec448e3c33f","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.328725Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:2697f48c0a37eea005ef4f76591857a8565f5def953cb7b4b6996a719dae036a","observation_id":"5a61dbaa-5afa-4bdb-af4a-d952a8e3dd2f","resolution":{"observed_at":"2026-08-07T12:30:35.967511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.656313Z","title":"VISTA- LLAMA: Reducing hallucination in video language models via equal distance to visual tokens,","venue":null,"work_id":"3f0c9b82-0aae-43a5-9fd0-b6e95463a840","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.421014Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:2840a07fa0f2a6fde1dfa75a6c43b60bb6079e3f12a71387a3e3587427186c37","observation_id":"e5458f8c-7aa0-41de-b65b-35e2535e1d72","resolution":{"observed_at":"2026-08-07T12:30:35.767758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.447292Z","title":"CogAgent: A visual lan- guage model for gui agents,","venue":null,"work_id":"055e43d7-324a-4d08-89b6-f589a7e899ac","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.562294Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:444a7b0d5ded1710360619f1d150a4efb043a1f85db14c4005915a362c80bd19","observation_id":"3c87cb0a-7f1d-46f9-a926-58e4b0f43823","resolution":{"observed_at":"2026-08-07T12:30:35.515474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.281456Z","title":"LLaV A-NeXT: Improved reasoning, OCR, and world knowledge,","venue":null,"work_id":"76054eaa-16cb-4222-9086-aa3fefdb2ff6","year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.653791Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:6689644b27ebf942ae838723bd7d3e9a695716d400619c5567246b4aebfda486","observation_id":"a087d91c-8ca7-4179-9248-8d249309ce08","resolution":{"observed_at":"2026-08-07T12:30:35.344142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:30:33.760176Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.760176Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:b3d0bc2a118b620046b0f485e001bf3fb2a80c74abe15b8c2515aefa0e628607","observation_id":"3bda2006-30c5-4bb7-a8ee-daf3b6c3f689","resolution":{"observed_at":"2026-08-07T12:30:33.760176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:35.152719Z","title":"NExT-QA: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"4532625e-b9c1-496b-8ef2-2fd48d01aa8f","year":2021},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:34.055988Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:7fe78fbfb56ddd8284e5fffa8d1d5d4ed76c861328a351c09a35cacce65caf41","observation_id":"16576960-2833-4818-a5b1-2a2608474e3c","resolution":{"observed_at":"2026-08-07T12:30:35.229409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:30:34.984261Z","title":"STAR: A benchmark for situated reasoning in real-world videos,","venue":null,"work_id":"f3e63c91-16de-40be-9598-97a036a5f0cf","year":2021},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:34.249618Z"},"links":{"citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:39184fe4efd2d76fa62e191df19a45dbfb1cf182acc99a2d8375ebaf5151293f","observation_id":"22ba6029-c29b-4815-abb5-4aeecc966736","resolution":{"observed_at":"2026-08-07T12:30:35.085113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:22:05.825056Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2505.24371."}