{"as_of":"2026-08-11T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31d83b3734aa03eaeedf53d836ecffedd97ff1c342ea69d7a80f1f5f1d20a600","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:31:35.440396Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14660/citation-record","integrity":"/paper/2607.14660/integrity","json":"/paper/2607.14660/citation-record.json","paper":"/paper/2607.14660"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-02T01:31:30.808242Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:30.808242Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:d19f8558d4b0310e228b1b06f113b9563a9bac0638f89abc0795a2db29b1374a","observation_id":"350ed441-ebff-4c5e-b479-0c701a26d7df","resolution":{"observed_at":"2026-08-02T01:31:30.808242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:30.907828Z","title":"Qwen2.5- vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:30.907828Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:eccd2a4a1815dd098fd4011206eb435419ead822ad84a2d196d84f7f61d2122f","observation_id":"a28276ac-3ad4-4f76-b9f2-23d5b57475bd","resolution":{"observed_at":"2026-08-02T01:31:30.907828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:30.960942Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:30.960942Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:af0d34b9d52b43944b32c505255ed66a180af6f14f7519d57631c7001854742c","observation_id":"104ed5e6-d95c-499b-b55d-ea8aaa581f14","resolution":{"observed_at":"2026-08-02T01:31:30.960942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.018426Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.018426Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:a443ed88cca3bbae5606508708da39c91c9601fd98e6c5c8cb60ac832955fac4","observation_id":"da5c962a-4642-4922-b1e1-2462a78e33a8","resolution":{"observed_at":"2026-08-02T01:31:31.018426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.059411Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.059411Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:ee416a1e8133c58c3604cc7f83705dd860c2c70b923c37df3d34bb361cf04c10","observation_id":"72463b02-1dd5-461c-a88e-3ed5632f56f1","resolution":{"observed_at":"2026-08-02T01:31:31.059411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T01:31:31.099617Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long con- text, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.099617Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:bed4a91cbd697b752683f32bb1d5876c172b9b840f7901d755c8be141e45a8a3","observation_id":"81667278-0fb3-4e8a-85e4-df24ff6f52fd","resolution":{"observed_at":"2026-08-02T01:31:31.099617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-02T01:31:31.178518Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.178518Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:2fd115840285164f3aa3964f0a4a7776fbfae50b80b2458eabefe7f840139545","observation_id":"c890907f-d153-4ce0-ad14-f46e5033db2b","resolution":{"observed_at":"2026-08-02T01:31:31.178518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.279417Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing.Advances in Neural Information Processing Sys- tems, 37:89098–89124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.279417Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:856bc08b06a26a1af6e91bc4f890bc803a4435b9bebdfc2205542cd6880c14ab","observation_id":"b7e71018-6caa-47fa-a741-b3a95aeeddef","resolution":{"observed_at":"2026-08-02T01:31:31.279417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-02T01:31:31.367516Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.367516Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:1bf7921f8bd2cf6a063638270d3ea8131d299a2345c4bbd7b580c81f2b4f3d65","observation_id":"5532ddc1-513c-45e9-a518-d689ccea4927","resolution":{"observed_at":"2026-08-02T01:31:31.367516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.461667Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.461667Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:1ebf7fc18296502a111f8fe65f997cb89f6c9c51aef57c0538be79ba72b2ce7f","observation_id":"e7c395a4-4b80-412d-b03d-900ec3c08d02","resolution":{"observed_at":"2026-08-02T01:31:31.461667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.564510Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.564510Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:1c78c576bc64cc1b652308833edc56c762f092872fe0f20ab96abf8f9f3a3963","observation_id":"8220fa8a-fa05-4d51-b365-f1cdf818c6e0","resolution":{"observed_at":"2026-08-02T01:31:31.564510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12844","last_updated":"2026-04-30T06:09:00Z","snapshot_observed_at":"2026-08-08T09:47:04.204560Z","submitted_at":"2025-03-17T05:43:40Z","title":"GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12844","snapshot_observed_at":"2026-08-02T01:31:31.645798Z","title":"Guidedog: A real-world egocentric multimodal dataset for blind and low-vision accessibility-aware guidance.arXiv preprint arXiv:2503.12844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.645798Z"},"links":{"cited_paper":"/paper/2503.12844","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:87be2f1c6d0670490f2afb2a709af3c9345e1ba042e06607fa4091455f6972dd","observation_id":"6f52859d-c07c-48e0-8162-ed4258cf077a","resolution":{"observed_at":"2026-08-02T01:31:31.645798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.765742Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.765742Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:d58a1fc21f68d69bc04bac83c391945d04b0d6ef4824ccb4881aa4db221922b9","observation_id":"baa8555d-099d-45a3-9a65-ac25b420c1fd","resolution":{"observed_at":"2026-08-02T01:31:31.765742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:31.889973Z","title":"VideoChat: chat-centric video understanding.Sci","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.889973Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:56499fa3f2f9dc676a372b8e59b4d8b485eeaf9f66658531eb57d7d8dc460535","observation_id":"bd045284-8201-4987-8319-f7b661619c2e","resolution":{"observed_at":"2026-08-02T01:31:31.889973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-08-10T23:47:22.591447Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-08-02T01:31:31.984732Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding?arXiv preprint arXiv:2501.05510, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:31.984732Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:110bcc1c82ca9e40b0b2f1e7347849ed9340d5f648c25a69bc8e29c17edd1833","observation_id":"204053fd-c1cc-4cfc-85d2-5c5e45f60e3b","resolution":{"observed_at":"2026-08-02T01:31:31.984732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-02T01:31:32.083457Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding.arXiv preprint arXiv:2411.03628, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.083457Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:87dbcaf4397ff08e1ec8a76a2547ee0b7789ecf032b208162c0bcef3fe1458dc","observation_id":"9c3daa94-44a1-42f8-9aef-9bfe00ebec93","resolution":{"observed_at":"2026-08-02T01:31:32.083457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:32.235246Z","title":"Soccernet-caption: Dense video captioning for soccer broadcasts commentaries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.235246Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:77daad33a3d11cf3ee61a6c23c8cacd19069ac0f19ae4cf80aea59e15d3d791a","observation_id":"6be8cea6-e5e5-46d6-bf42-479208ef97eb","resolution":{"observed_at":"2026-08-02T01:31:32.235246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:32.346176Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.346176Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:f643832607b74c9432cc903c612e193e513ddc549f4a4323619cc230ee24dd48","observation_id":"126587eb-e3ec-4840-866c-77deab1ea122","resolution":{"observed_at":"2026-08-02T01:31:32.346176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:32.458146Z","title":"Introducing gpt-5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.458146Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:00a5df06525fb56d2ef8d64329ea0120c95aa1bee275f1184c71f5375e300807","observation_id":"1492b640-767c-418d-aaef-dc6bd071be0c","resolution":{"observed_at":"2026-08-02T01:31:32.458146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19794","last_updated":"2024-05-30T08:02:05Z","snapshot_observed_at":"2026-08-10T07:17:42.560880Z","submitted_at":"2024-05-30T08:02:05Z","title":"Video Question Answering for People with Visual Impairments Using an Egocentric 360-Degree Camera","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19794","snapshot_observed_at":"2026-08-02T01:31:32.558144Z","title":"Video question answering for people with visual impair- 9 ments using an egocentric 360-degree camera.arXiv preprint arXiv:2405.19794, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.558144Z"},"links":{"cited_paper":"/paper/2405.19794","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:eea36aa2f75c43543e1cdd5bb134d6201457c23033fb7509facc7a06d1a776ac","observation_id":"e1f6aa03-8eba-4e19-99f7-88b86b1fa217","resolution":{"observed_at":"2026-08-02T01:31:32.558144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T01:31:32.636396Z","title":"Gemini 1.5: Unlocking mul- timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.636396Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:9ee72fca4f37b18fec47a8b1e2a6099ebfc4f0fc3d0ee35fcfcd676855ee9a24","observation_id":"ddbad610-289c-432b-887e-3d67d8c13f89","resolution":{"observed_at":"2026-08-02T01:31:32.636396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-02T01:31:32.727805Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.727805Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:20eb3a1ef5ded26773b6efe08159f0a741190553551840885c1aacf3e4efcbb7","observation_id":"460b9bba-30f6-449d-b853-363d7d175624","resolution":{"observed_at":"2026-08-02T01:31:32.727805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:32.839384Z","title":"Dynamic crosswalk scene understanding for the visually impaired.IEEE transactions on neural systems and rehabilitation engineering, 29:1478–1486, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.839384Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:4f0282477408ac17b220badf219b2b193e6e3423d6cc3e97c150dc982598633a","observation_id":"92b448e8-061a-4980-bc24-1a09c0a7d94c","resolution":{"observed_at":"2026-08-02T01:31:32.839384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:32.951283Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:32.951283Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:c8c084777988864bcf8db001d4bec081bf6860326990575c203715cc4699fc61","observation_id":"9b14334a-8130-47e0-b454-4f5cd4a8718b","resolution":{"observed_at":"2026-08-02T01:31:32.951283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T01:31:33.031529Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.031529Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:51cb946598f274277554d6ed4994d76c26933e5d943e7733edd840d407ca84fa","observation_id":"f72783c2-7086-45dd-a315-db26a9ebe83a","resolution":{"observed_at":"2026-08-02T01:31:33.031529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-02T01:31:33.119841Z","title":"Lvbench: An extreme long video understanding benchmark.arXiv preprint arXiv:2406.08035, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.119841Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:866b1d2e12a2d3d2c8a5833b81d893e5b01ab6deca228231f8882a4c99d66ce2","observation_id":"b3acc4c3-35fc-4682-8077-cb04f7545922","resolution":{"observed_at":"2026-08-02T01:31:33.119841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T01:31:33.199635Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.199635Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:3f35af0e5bf47cc570a32fdac9925679d14c46d2ea1ef5d0d855ab12455a5607","observation_id":"49ade3f9-9cfa-45d9-82f1-754f007c775e","resolution":{"observed_at":"2026-08-02T01:31:33.199635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:33.269398Z","title":"A dataset for the visually impaired walk on the road.Displays, 79:102486, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.269398Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:f1ecd31cdfe73f2116e97dfefeccccf0cd009bd49f11b12fd804a61edbac1b5b","observation_id":"ff61a051-86b3-4cf4-a9a7-68ab8ab1d946","resolution":{"observed_at":"2026-08-02T01:31:33.269398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:33.327592Z","title":"Egoblind: Towards egocentric visual assistance for the blind people","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.327592Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:fd0e35d78acd4c48ff43124d85be71f542491bd66ae33398cb2792eb1f18e213","observation_id":"12d33cd0-f805-4853-b182-7f1021af1a8e","resolution":{"observed_at":"2026-08-02T01:31:33.327592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-08-08T02:53:06.532732Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09608","snapshot_observed_at":"2026-08-02T01:31:33.380541Z","title":"Streamingvlm: Real-time understanding for infinite video streams.arXiv preprint arXiv:2510.09608, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.380541Z"},"links":{"cited_paper":"/paper/2510.09608","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:05f594433f8dbc78937ed4f4e48c2e891465db870e39471d4993c2755b2ec912","observation_id":"72733ed7-69fc-48b7-82d0-986107f5e850","resolution":{"observed_at":"2026-08-02T01:31:33.380541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:33.480564Z","title":"Vias- sist: Adapting multi-modal large language models for users with visual impairments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.480564Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:4ee7f6d935f1966800218e81e4e3951a78d893aa9719f337b3ec26d08c3382d0","observation_id":"f579c635-1225-4dcc-b789-923144bdf56d","resolution":{"observed_at":"2026-08-02T01:31:33.480564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-02T01:31:33.586953Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.586953Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:a8142a72716183c91108e3995c450dcfd4dd822074b590bc2d60224af3049636","observation_id":"ffd7a195-7577-4261-a381-2cbc131d1326","resolution":{"observed_at":"2026-08-02T01:31:33.586953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:33.659196Z","title":"Lytnet: A convolu- tional neural network for real-time pedestrian traffic lights and zebra crossing recognition for the visually impaired","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.659196Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:f525dc55c74815d9f546843e853dd5de46bb97dd959468de90a14fe74c47246c","observation_id":"0a97bc8d-34f2-464f-a51c-c917abe33b98","resolution":{"observed_at":"2026-08-02T01:31:33.659196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:33.717721Z","title":"Street crossing aid using light-weight cnns for the visually impaired","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.717721Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:f9c9ee20789c8c6364930add95f6539ac2673fa6d95e19ed00eab17002945808","observation_id":"fbe7b363-5f8d-4784-aea7-12ec28a7d4f2","resolution":{"observed_at":"2026-08-02T01:31:33.717721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-02T01:31:33.785042Z","title":"Minicpm-v 4.5: Cooking effi- cient mllms via architecture, data, and training recipe.arXiv preprint arXiv:2509.18154, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.785042Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:b661bfbe822edc911e08de5a154bfaee1d52c776181e4cda02f40e1129026457","observation_id":"2bc63281-9a5b-4c68-a874-38b8f63a8898","resolution":{"observed_at":"2026-08-02T01:31:33.785042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-02T01:31:33.870528Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.870528Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:794f51bdd4716f772ac4e130fd77d8e34bbfd7f3e8e6da0420b0329cd80dd365","observation_id":"3410e311-afad-44f9-9a67-4097cdd5ed39","resolution":{"observed_at":"2026-08-02T01:31:33.870528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-11T09:47:01.026583Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20903","snapshot_observed_at":"2026-08-02T01:31:33.936559Z","title":"Walkvlm: Aid visually impaired people walking by vision language model.arXiv preprint arXiv:2412.20903, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.936559Z"},"links":{"cited_paper":"/paper/2412.20903","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:a3819f692cdf239f8c53f87ee72e62f0ab201e0689d0d99cfa3736703e097dd6","observation_id":"275778dc-f220-43d0-9bd5-8ae77c0d927f","resolution":{"observed_at":"2026-08-02T01:31:33.936559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-02T01:31:34.037402Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.037402Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:5da55046068f9924a2c2c8e41caf43b3375f837fa1c92681b0e0484c66769365","observation_id":"dfda267a-895d-4183-afb2-0cb069e52fab","resolution":{"observed_at":"2026-08-02T01:31:34.037402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-02T01:31:34.112289Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.112289Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:bf189bd7ed69e56ebbb3e803bd3efab5311748ff493f76736d1185712abb0eee","observation_id":"91910fae-f71d-49a9-8632-1ea80985d9ab","resolution":{"observed_at":"2026-08-02T01:31:34.112289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:34.265010Z","title":"Evaluation Settings Proactive Reminder.Offline models are evaluated using TPAD, while online models are tested with their default in- ference interfaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.265010Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:7b7e6f966fffb357e712dc2db55b4fdc6cb8e1fffa0c1a9c6d14912ffb5363f0","observation_id":"42bd7c97-7041-4810-89c2-66233219f403","resolution":{"observed_at":"2026-08-02T01:31:34.265010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:34.406526Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.406526Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:45d2b8a8a8ca6b2bb998d393f93b8b1f1bf09e5c58dd358a69cdd2c0b7039bcb","observation_id":"e8c0b588-0277-403a-b99b-1ae54b9197fa","resolution":{"observed_at":"2026-08-02T01:31:34.406526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:34.568528Z","title":"Is there a tactile paving nearby?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.568528Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:343f43528a1aa72e459c67d9c67f72e6152616b7fca3c8167ee63f15d7a3d2a9","observation_id":"9692327a-b28d-4d6e-a61f-41be67f39ffe","resolution":{"observed_at":"2026-08-02T01:31:34.568528Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:34.702514Z","title":"shows the remaining time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.702514Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:e6e4c3dd855ed28808f8ef1688dcc14f347c26e88107eca3edabbc3bf5c225b4","observation_id":"c030fcbe-f24e-437b-9835-c3674542bc7c","resolution":{"observed_at":"2026-08-02T01:31:34.702514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:34.843032Z","title":"visible,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.843032Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:3fe47fef549b90bea120e3a1d1fef6f52cc92ebbf6d90fbaae0ff8a362528c15","observation_id":"39fd4adc-5e50-4bac-9347-623dca9223f0","resolution":{"observed_at":"2026-08-02T01:31:34.843032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:34.958195Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:34.958195Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:21a7a4a933646307451ddd97313f9e53760c29564a1bf66b81be2c8b66214836","observation_id":"a0237c45-f392-49b5-b470-0717ac2ee919","resolution":{"observed_at":"2026-08-02T01:31:34.958195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:35.118365Z","title":"A wall blocks the end of the tactile path ahead","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:35.118365Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:23cf9863430554a80ce1868553c150aeb4c3dc9654236ba454270abf71f9879f","observation_id":"32134753-5c63-4686-99e3-de4f7df65422","resolution":{"observed_at":"2026-08-02T01:31:35.118365Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:35.288487Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:35.288487Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:c1c7d65502c6e95ee1dd3ffd2f011cbe319c1c911eee82c320ff66e995dfa0d0","observation_id":"16edf162-e385-4204-a330-67f7caea9f0c","resolution":{"observed_at":"2026-08-02T01:31:35.288487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:35.361770Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:35.361770Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:ecaf15fa1b338633e2eaa8ae8270a8d206baccf5b4a515802b531bb40af28eb5","observation_id":"b236d7d0-dd92-444d-9e6f-2311a8f0c1fe","resolution":{"observed_at":"2026-08-02T01:31:35.361770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:31:35.440396Z","title":"Wait, red","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:35.440396Z"},"links":{"citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:ba3bcccd117ea444406b776b38347d8a04ce591fd5c4d639cd5052d2e8d6d011","observation_id":"ee5fdfc4-7769-46a1-959f-98a24d528386","resolution":{"observed_at":"2026-08-02T01:31:35.440396Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T12:02:35.918539Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2607.14660."}