{"as_of":"2026-08-18T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:792804a22a4ee1fe831b08a66e16bf11925767106c575cba8a7826c61f79c41d","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:12:19.269126Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:47.468600Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T10:27:19.601310Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20903","snapshot_observed_at":"2026-08-07T05:43:47.468600Z","title":"Walkvlm: Aid visually impaired people walking by vision language model.arXiv preprint arXiv:2412.20903, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07227","last_updated":"2025-06-08T17:23:36Z","snapshot_observed_at":"2026-08-13T16:27:43.821051Z","submitted_at":"2025-06-08T17:23:36Z","title":"Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:47.468600Z"},"links":{"cited_paper":"/paper/2412.20903","citing_paper":"/paper/2506.07227"},"observation_digest":"sha256:9a634c55ac1b22cba7bc5550943a5887a2d0750c34cb37175c698fa5f8b17c50","observation_id":"1b62c9c2-7faa-47de-b423-b5ce211a1ec8","resolution":{"observed_at":"2026-08-07T05:43:47.468600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"cited_work":{"arxiv_id":"2412.20903","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20903","snapshot_observed_at":"2026-08-05T10:27:19.601310Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","venue":"cs.CV","work_id":"1025b5ee-4b74-40bf-b621-5786ba5461f5","year":2024},"citing_paper":{"arxiv_id":"2509.05374","last_updated":"2025-09-04T11:39:22Z","snapshot_observed_at":"2026-08-17T04:15:49.407321Z","submitted_at":"2025-09-04T11:39:22Z","title":"A Synthetic-to-Real Dehazing Method based on Domain Unification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:27:19.315551Z"},"links":{"cited_paper":"/paper/2412.20903","citing_paper":"/paper/2509.05374"},"observation_digest":"sha256:2829987aa90e19c1adac28aa2505b28cbb3dc3a289b29aa47d94a9552028ceb8","observation_id":"87118920-cd2e-4364-bbde-4b910d574726","resolution":{"observed_at":"2026-08-05T10:27:19.605209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20903","snapshot_observed_at":"2026-08-02T01:31:33.936559Z","title":"Walkvlm: Aid visually impaired people walking by vision language model.arXiv preprint arXiv:2412.20903, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14660","last_updated":"2026-07-16T07:25:17Z","snapshot_observed_at":"2026-08-15T17:58:27.337094Z","submitted_at":"2026-07-16T07:25:17Z","title":"VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:31:33.936559Z"},"links":{"cited_paper":"/paper/2412.20903","citing_paper":"/paper/2607.14660"},"observation_digest":"sha256:79db9cf30beb2573f7c5ef9ef5a10d121b136233d6c3e7a40ad10ea67bfe4c45","observation_id":"275778dc-f220-43d0-9bd5-8ae77c0d927f","resolution":{"observed_at":"2026-08-02T01:31:33.936559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20903/citation-record","integrity":"/paper/2412.20903/integrity","json":"/paper/2412.20903/citation-record.json","paper":"/paper/2412.20903"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T23:12:18.822707Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.822707Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:fd1f63261182e65fb5a50c078acbfee730e2f231d37ed4dab20dcfefb6df7d7f","observation_id":"f52fc303-8b30-48d9-9058-601391939d1c","resolution":{"observed_at":"2026-08-10T23:12:18.822707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.828631Z","title":"Vita: An efficient video-to-text algorithm using vlm for rag-based video analysis system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.828631Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:31e285962426107688a555a60f9d5d32566be00c1a8c72c7e423b75cf4a30220","observation_id":"7202eaf0-a26a-484f-8222-db5c74ce1942","resolution":{"observed_at":"2026-08-10T23:12:18.828631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T23:12:18.834185Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.834185Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:b9787b3995601413f8c0a2bd9d1cab5b8adebb2029ced5642a570c12bfaa4289","observation_id":"11a9bc38-acf2-4145-83cc-3a3e341bdaf5","resolution":{"observed_at":"2026-08-10T23:12:18.834185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-16T13:49:00.762109Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-10T23:12:18.839807Z","title":"An introduction to vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.839807Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:733e60c1960887a2d9a4d33ac7b487a303d0aaea8d4013d03901778bbcd12b35","observation_id":"0ccfd3ce-1ff7-4a24-abb1-826d6c43ba69","resolution":{"observed_at":"2026-08-10T23:12:18.839807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.845410Z","title":"Visual challenges in the ev- eryday lives of blind people","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.845410Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:ce508713fe3b441a085bdaf203a7c1773e0f55379f0cb7cf71502d8aca34250a","observation_id":"06b2125e-953a-4853-bb03-830085277315","resolution":{"observed_at":"2026-08-10T23:12:18.845410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16160","last_updated":"2024-01-30T15:44:58Z","snapshot_observed_at":"2026-08-17T07:39:58.326895Z","submitted_at":"2024-01-29T13:48:36Z","title":"LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16160","snapshot_observed_at":"2026-08-10T23:12:18.850612Z","title":"Llava-mole: Sparse mixture of lora experts for mitigating data con- flicts in instruction finetuning mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.850612Z"},"links":{"cited_paper":"/paper/2401.16160","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:4f5e7fdf78804102736f2e4921d268131af1f695c8a7e3c2b0f323f8f4343cb6","observation_id":"9a9e43a5-f4e5-409f-b179-afeb400b7982","resolution":{"observed_at":"2026-08-10T23:12:18.850612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.856175Z","title":"Vqask: a mul- timodal android gpt-based application to help blind users vi- sualize pictures","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.856175Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:b3193b4dad1bd1e2351e1a8a6d24fbe2ff527d970798ec5ba9c161eeb3766d70","observation_id":"0001c851-8763-4979-b3c1-820ceeda2815","resolution":{"observed_at":"2026-08-10T23:12:18.856175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-18T08:41:13.372775Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-10T23:12:18.861631Z","title":"A survey of vision-language pre-trained models.arXiv preprint arXiv:2202.10936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.861631Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:a2030930790037d3772be46888222ffd4a310b1faf088eb4c5a5f3bba4807c24","observation_id":"cb97ee31-e4fb-4f8b-a4a4-10a0bad6c347","resolution":{"observed_at":"2026-08-10T23:12:18.861631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T23:12:18.867167Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.867167Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:f5b995511f183e272d0e88044b2fa658eb9ba39ea598f9605d6303a280c1f802","observation_id":"586200d8-9149-4ea1-88bf-fa3a01093d21","resolution":{"observed_at":"2026-08-10T23:12:18.867167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-10T23:12:18.873026Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.873026Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:265a09d2e064866401ab214516b635c7374d3b086bcc8fa55a63fbc06efbc99b","observation_id":"a4401e45-68f3-4709-8f05-a00c197ca5ed","resolution":{"observed_at":"2026-08-10T23:12:18.873026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.878194Z","title":"Use of an indoor navigation system by sighted and blind trav- elers: Performance similarities across visual status and age","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.878194Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:302aa94482cc5a4e13fccfe901e9403ff166b8433a1c2984c02cce2cf1c4604c","observation_id":"6af24839-795c-4ce7-9201-21a9350a9e55","resolution":{"observed_at":"2026-08-10T23:12:18.878194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.883014Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.883014Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:287cf6b1a2866bddd0e17570dea1c8436bd9b6441269b19bb8f52ece16a54498","observation_id":"017c7324-1de4-405d-a529-f47cca0d25a5","resolution":{"observed_at":"2026-08-10T23:12:18.883014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.887823Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.887823Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:de04eb644ada8e4ec8d9f4c8994a2f46d66599adbab46ef45cc2011c3dd672bb","observation_id":"df14e819-ff0b-4714-80f8-d7086bb0599e","resolution":{"observed_at":"2026-08-10T23:12:18.887823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.893207Z","title":"Assistive technol- ogy for visually impaired and blind people","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.893207Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:8c133952b3b1b391d2ba80231d8e7c6b79ae19d3b0d4971818703dbdba9b9542","observation_id":"2d3d64e1-afd2-4c35-bea6-aa88973b9ae5","resolution":{"observed_at":"2026-08-10T23:12:18.893207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T23:12:18.898031Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.898031Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:9a5214c0762269f22135da56b4d757d0a00f7c13310bc21ff7a75cb74b83f9e0","observation_id":"0a1dc93b-3d1e-4b5c-bd34-f77659eed05d","resolution":{"observed_at":"2026-08-10T23:12:18.898031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.903088Z","title":"A dataset for crucial object recognition in blind and low-vision individuals’ navi- gation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.903088Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:c5d1c1e173865ff5935c5dd5abf5798956b353d0a08ba95fe9fe349b7b6f35a0","observation_id":"213d03a7-2377-45c0-8c65-8b667fc1325a","resolution":{"observed_at":"2026-08-10T23:12:18.903088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13175","last_updated":"2024-08-23T15:50:50Z","snapshot_observed_at":"2026-08-16T13:24:17.836007Z","submitted_at":"2024-08-23T15:50:50Z","title":"Identifying Crucial Objects in Blind and Low-Vision Individuals' Navigation","version":1},"cited_work":{"arxiv_id":"2408.13175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13175","snapshot_observed_at":"2026-08-10T23:12:19.724700Z","title":"Identifying Crucial Objects in Blind and Low-Vision Individuals' Navigation","venue":"cs.CV","work_id":"6f9f48e2-d16c-4c16-8d2b-56d1dab43c2d","year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.907994Z"},"links":{"cited_paper":"/paper/2408.13175","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:fec1abedd5f16597d56a9f09a4b839e421fb08216deaaa3f45b1929477a5512b","observation_id":"9b83c1b7-51b2-4478-8959-164e322aee14","resolution":{"observed_at":"2026-08-10T23:12:19.732215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.788817Z","title":"” i want to figure things out”: Supporting exploration in navigation for peo- ple with visual impairments","venue":null,"work_id":"8e821eae-7f83-4f4a-aaf9-ddb984cafd22","year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.913317Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:eb90edb61870ff00e0ee054a6477926ca12486fde43e55b847b8990743dca6ed","observation_id":"f1059897-ac53-4b8c-9ce5-f0a9b34651e7","resolution":{"observed_at":"2026-08-10T23:12:20.794011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.918415Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.918415Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:9a77a636c9ad2b68c0c57b895f8fa1611b63217bd21d15d60401594060a9feb9","observation_id":"0926ee64-b7d7-4c1d-b1fe-c4cb63c78c17","resolution":{"observed_at":"2026-08-10T23:12:18.918415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.923209Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.923209Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:eedb397eb777c4eccb9d78a1423efa76bd1440a54d0cd26f1c499c6ded5cab68","observation_id":"b4aa0c02-e0f1-4e3a-a141-e0cde444e082","resolution":{"observed_at":"2026-08-10T23:12:18.923209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.761320Z","title":"Chatgpt for visually impaired and blind","venue":null,"work_id":"3a08cb6d-aa75-4e02-9b44-e36d93877091","year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.928205Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:3ae699ce40e6dc9ff60dde811bd42be7c9b422fa193f0ac7c3603cd70ca0c126","observation_id":"de37c228-7a18-40d0-942e-06c069b693a8","resolution":{"observed_at":"2026-08-10T23:12:20.767539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.745007Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"a81628a5-e2f3-4a5f-b030-bb282e9e8778","year":2020},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.933093Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:821498c8e37509371ba81d4297b31f7c2da6014c0ff618b8954d37c5748c0faa","observation_id":"e3f89609-0b6d-4a67-80cc-804876014e47","resolution":{"observed_at":"2026-08-10T23:12:20.750199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.727890Z","title":"Llava-med: Training a large language- and-vision assistant for biomedicine in one day","venue":null,"work_id":"7c2f85bc-403a-49e1-b292-bff09a68956e","year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.938312Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:dcb0ee5865d2fb8f399f725cf1e6a5ea276283383180a69a885af1c8ad888c9d","observation_id":"e72f415e-5355-4c8b-b0cf-73fd43ccda11","resolution":{"observed_at":"2026-08-10T23:12:20.733274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.943072Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.943072Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:914aa757c3288df5d8ff34f69112948c8d91025b1e42d6aa4f983730bb0a673e","observation_id":"f09d8a39-508e-4f99-add2-eaee27cc9d50","resolution":{"observed_at":"2026-08-10T23:12:18.943072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.701789Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"3a8d2133-482d-4ec5-afa2-3bd50444a64e","year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.948039Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:d0ddf677000cf347e9ddeecdded0dd22368dc53d44c425856995e8eef3cc6b21","observation_id":"35f932c6-09d4-4a42-82b1-15414b745edb","resolution":{"observed_at":"2026-08-10T23:12:20.706756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.685658Z","title":"Visual instruction tuning","venue":null,"work_id":"dc3729bd-2890-425c-8387-c835b82b60e2","year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.953733Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:984fa4a3ab8e3254ad32d4d80891f036b182cf3a64c09b5de721ee06037285be","observation_id":"44c019d7-51bd-48d4-ba9d-848a5613a953","resolution":{"observed_at":"2026-08-10T23:12:20.691188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.669246Z","title":"Open scene understanding: Grounded situation recognition meets segment anything for helping people with visual im- pairments","venue":null,"work_id":"c858a6e6-bd41-4ac7-97c0-6750fa5a2105","year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.958759Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:c1c43d1919aebc2b617341439c89b539735aa325211a1e3f6b963d572ff319c4","observation_id":"525623e0-908c-41aa-98d1-331accf9a211","resolution":{"observed_at":"2026-08-10T23:12:20.674836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:18.963672Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.963672Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:ee7eb6884a24f3605ed7ac488f5cae9accb09f3bc75322183424a8a5262b1979","observation_id":"3cf7393c-d555-4072-bcdf-389a75837bcc","resolution":{"observed_at":"2026-08-10T23:12:18.963672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T23:12:18.968985Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.968985Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:db1931e73c4a07b0825168fd43af539252a2313d3b5cc0199e2b5c749a7848ec","observation_id":"99d9adcb-aa44-4a1c-b502-9e975a02b15a","resolution":{"observed_at":"2026-08-10T23:12:18.968985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08219","last_updated":"2024-07-11T06:40:36Z","snapshot_observed_at":"2026-08-18T10:37:51.104017Z","submitted_at":"2024-07-11T06:40:36Z","title":"Generating Contextually-Relevant Navigation Instructions for Blind and Low Vision People","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08219","snapshot_observed_at":"2026-08-10T23:12:18.974180Z","title":"Generating contextually- relevant navigation instructions for blind and low vision peo- ple","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.974180Z"},"links":{"cited_paper":"/paper/2407.08219","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:3a4a9be465bd834d2ce223b4b79ed86184197f55860e8317781217661314a524","observation_id":"1be9513b-3f96-4dfe-80ec-af8dee216dde","resolution":{"observed_at":"2026-08-10T23:12:18.974180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.638723Z","title":"Using tf-idf to determine word relevance in document queries","venue":null,"work_id":"f042a5c9-4da4-4360-a7ad-ad95a2730520","year":2003},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.979233Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:80bb67a363dcdb2bfa8c25dd1d9db4fb08a8bd0d0efc18250ad09d155cc6d012","observation_id":"62f5f3a1-c6f9-4e3d-8fdc-93ca5a038127","resolution":{"observed_at":"2026-08-10T23:12:20.645451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.621718Z","title":"Navigation systems for the blind and visually impaired: Past work, challenges, and open problems","venue":null,"work_id":"38ba30fe-d8f9-4861-95c0-a6c31b9f01b7","year":2019},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.984141Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:1510511e32c8e78de9325e63fd2f29a915d03583d62b6d1b97e71f3fdc39b607","observation_id":"cf099bac-4f3c-4aba-a4f8-a191003c10d5","resolution":{"observed_at":"2026-08-10T23:12:20.627120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T23:12:18.989071Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.989071Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:a475cc6f86d672d42149763cc0c32a548b08989c506684eb5c0ee1e4dfd3cb3c","observation_id":"ce947ee3-bd5f-47ed-af7a-6d3121b73e56","resolution":{"observed_at":"2026-08-10T23:12:18.989071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-16T13:39:53.511689Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-10T23:12:18.994353Z","title":"Math- llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:18.994353Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:763bd40d39e50ada7a2825f31964f41970cea8e87fa914de3d1cbda69019056d","observation_id":"71317cfe-cb63-4ba1-a9dd-8a997b2b570d","resolution":{"observed_at":"2026-08-10T23:12:18.994353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.604798Z","title":"A dataset for the recognition of obstacles on blind sidewalk","venue":null,"work_id":"58f6a92b-5e03-4423-ac54-9538cd21be16","year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.000847Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:83c492d3a33ab52f251e6e9d614f8d39a7af03fdbdefe10e4db3d22ed707f223","observation_id":"9772810b-3dbd-4730-a911-0711c1664b89","resolution":{"observed_at":"2026-08-10T23:12:20.610340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.587113Z","title":"Dynamic crosswalk scene understanding for the vi- sually impaired","venue":null,"work_id":"8be5ea64-ca0a-4071-be01-e4d4f9f26557","year":2021},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.005636Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:d02c1177291669cabff6fe1c976b21c62d5e76a6ee46ac134f674db7a1fc12a8","observation_id":"f4c8b7c4-a347-471d-b77e-152bc9f1b93b","resolution":{"observed_at":"2026-08-10T23:12:20.592475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-10T23:12:19.010537Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.010537Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:5dc4f2b10eb7ac009488b12071194e8e87445f053bfad27660e9b5d55a56c95a","observation_id":"969e7d32-e4a4-4869-a7b5-143c3411c930","resolution":{"observed_at":"2026-08-10T23:12:19.010537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12415","last_updated":"2024-03-19T03:55:39Z","snapshot_observed_at":"2026-08-18T03:50:57.076409Z","submitted_at":"2024-03-19T03:55:39Z","title":"VisionGPT: LLM-Assisted Real-Time Anomaly Detection for Safe Visual Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12415","snapshot_observed_at":"2026-08-10T23:12:19.015582Z","title":"Visiongpt: Llm- assisted real-time anomaly detection for safe visual naviga- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.015582Z"},"links":{"cited_paper":"/paper/2403.12415","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:85e48661f85f3b9c8186370389da60047d2b7e0ba65d6332c744350e6871f0f9","observation_id":"9731851f-65c8-4063-a455-ef162f7bef95","resolution":{"observed_at":"2026-08-10T23:12:19.015582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T23:12:19.020845Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.020845Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:967f9c8be0b9ea68cca81bc267a7b3c606ae3fe85701a302f129ad87e203a162","observation_id":"bf1c821a-2402-4dc7-81b4-66bfa34878b7","resolution":{"observed_at":"2026-08-10T23:12:19.020845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.569563Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":"492273e8-353b-487d-bc5e-5b95400d0205","year":2022},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.026210Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:3a6014062c0d601bbd08d335498503a6f8b6e1636002e5319448001476b3aad6","observation_id":"25380c0b-0bf2-4c30-a9df-3ce8ef6ac537","resolution":{"observed_at":"2026-08-10T23:12:20.575753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.552828Z","title":"A dataset for the visually impaired walk on the road","venue":null,"work_id":"71ad9c48-04b5-4d45-8570-f0b7116528ab","year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.031353Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:b894a454f05848c03c1591d9fd0e3b029946ef1b95bbb4edae9279fd6cb35fae","observation_id":"874f4fd7-562b-44d9-9b76-bf5cad97e02c","resolution":{"observed_at":"2026-08-10T23:12:20.558120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08882","last_updated":"2024-07-11T22:11:52Z","snapshot_observed_at":"2026-08-16T13:34:56.111997Z","submitted_at":"2024-07-11T22:11:52Z","title":"Emerging Practices for Large Multimodal Model (LMM) Assistance for People with Visual Impairments: Implications for Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08882","snapshot_observed_at":"2026-08-10T23:12:19.036552Z","title":"Emerging practices for large multimodal model (lmm) assistance for people with vi- sual impairments: Implications for design","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.036552Z"},"links":{"cited_paper":"/paper/2407.08882","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:3ab42f4549d70f8393ce927618644b43509da315c0713f9a9efa7e0edb707579","observation_id":"45d1efec-567f-427b-a136-c21455aae58d","resolution":{"observed_at":"2026-08-10T23:12:19.036552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.536501Z","title":"A survey of efficient fine- tuning methods for vision-language models—prompt and adapter","venue":null,"work_id":"4e23d307-150d-4a44-84af-531c10fb9131","year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.041730Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:5d8da364882fa3cd614524569f66638ee120bc5c75050e8cb688c76f5bb7544d","observation_id":"16a92f8c-6dca-45b9-959a-7016c6f9c437","resolution":{"observed_at":"2026-08-10T23:12:20.542181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T23:12:19.046729Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.046729Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:3a4686a9b2a6cd16186d03f9c50987d2e63219768576e82d81fa370c8bb58719","observation_id":"3127d5e9-485d-453c-a7bd-b11d37bd10f8","resolution":{"observed_at":"2026-08-10T23:12:19.046729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02508","last_updated":"2024-04-03T06:53:27Z","snapshot_observed_at":"2026-08-16T14:04:03.615024Z","submitted_at":"2024-04-03T06:53:27Z","title":"VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02508","snapshot_observed_at":"2026-08-10T23:12:19.051938Z","title":"Vias- sist: Adapting multi-modal large language models for users with visual impairments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.051938Z"},"links":{"cited_paper":"/paper/2404.02508","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:6c45b6ee7372fd76765f956889aef9543fc389f0eca503ee2aa28ef48489d93c","observation_id":"3f7b3f7b-10d2-4eea-ae66-1f8cb4f9b6b5","resolution":{"observed_at":"2026-08-10T23:12:19.051938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.520055Z","title":"Seeway: Vision- language assistive navigation for the visually impaired","venue":null,"work_id":"4be8e97b-cd9f-4aa3-be38-c370f3462d3c","year":2022},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.057234Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:e7a7884e063a26e69f1e73c16b44964339a3dabbff46ad05c87b752d8799e99c","observation_id":"619fc4b8-0eb3-4b5b-91a1-03417a34a3df","resolution":{"observed_at":"2026-08-10T23:12:20.525355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T23:12:19.062819Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.062819Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:bd5a7c6ce079d4e53df00fd3d6157593d8d85f15ba27eb7e64fbccb17dc33b21","observation_id":"68a87777-4a55-48e2-9ca2-812259c9f4dc","resolution":{"observed_at":"2026-08-10T23:12:19.062819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-10T23:12:19.068765Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.068765Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:4efb9f1df0dbf49153a93900a40de3471ecf54c09d086a17498cb92faecae0e2","observation_id":"87fb6fc1-3a14-40d5-88bb-2e12276bf99d","resolution":{"observed_at":"2026-08-10T23:12:19.068765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:19.073764Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.073764Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:56ffb4ac9b2e8f94dc22c150d0a7ee949c596b0b8160f0498e5e4c28ef6b32eb","observation_id":"e76e4dc2-ef84-4155-86ac-8c64ee39b27b","resolution":{"observed_at":"2026-08-10T23:12:19.073764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.493718Z","title":"Grfb-unet: A new multi-scale attention network with group receptive field block for tactile paving segmentation","venue":null,"work_id":"99c60cd4-2bed-4487-8d08-764533ae1d58","year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.078879Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:6b0cc6f33bb234ab33c0b9cfb3a3fbf8220e76b6b41b292fe59c1a18a9542e19","observation_id":"e60cf562-c603-4dd6-a3a9-d35626a63be9","resolution":{"observed_at":"2026-08-10T23:12:20.498924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-10T23:12:19.083793Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.083793Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:d53775f7db22bf016a44defebac82d740f1821ead941a85ce8a196631d6baf58","observation_id":"7e87c874-6c10-4bef-94ff-43e2ef0e531f","resolution":{"observed_at":"2026-08-10T23:12:19.083793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01735","last_updated":"2024-02-10T14:08:55Z","snapshot_observed_at":"2026-08-16T14:23:45.645601Z","submitted_at":"2024-01-29T08:28:32Z","title":"VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01735","snapshot_observed_at":"2026-08-10T23:12:19.089009Z","title":"Vialm: A survey and benchmark of visually impaired assis- tance with large models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.089009Z"},"links":{"cited_paper":"/paper/2402.01735","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:7193b9bc4d2c8f431f2f4d5a7b0b6a0bf3b46cae5b060916d81f9c61f78a1480","observation_id":"5a7d3576-7308-4938-9d88-c5d7f3db478d","resolution":{"observed_at":"2026-08-10T23:12:19.089009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:19.094171Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.094171Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:5f6622fd90d8a8c0c908ebe0d056ab3d1affb4a22ca6d1fd0f8dcde0c597b205","observation_id":"afb450c2-2367-4618-873a-f6a6be4895de","resolution":{"observed_at":"2026-08-10T23:12:19.094171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.466495Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"5476044f-8b25-4779-9de6-bbfb43218ca3","year":2022},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.099057Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:6dddd51f3d95cc1232dfa2896186765f32f9df92a084684c20240c8cf2454954","observation_id":"b57bb9e5-23df-4485-9a44-c3fb7e64b069","resolution":{"observed_at":"2026-08-10T23:12:20.472133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-16T23:07:47.630457Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-08-10T23:12:19.104157Z","title":"Llava- ϕ: Efficient multi-modal assistant with small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.104157Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:196e48dd5af980e92f66aa259c55f8db193cd43b1720efce6ea60d62dec79cbc","observation_id":"066c069c-f4d9-4b05-9906-c9891d41afa8","resolution":{"observed_at":"2026-08-10T23:12:19.104157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.451275Z","title":"Data Collection","venue":null,"work_id":"2ea79d2f-8eb6-4140-91cd-b8bed872ba07","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.109481Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:ac6302047b62b887e5bcc3e67c2effbb4d7dc8c1f305c17d07871cbd98fefd84","observation_id":"966a674f-d632-4b28-839d-0d770faececa","resolution":{"observed_at":"2026-08-10T23:12:20.456047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.435574Z","title":"Problem Formulation","venue":null,"work_id":"243656db-027f-4988-8980-0c76f22d4b2a","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.114364Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:357ead9c12c8da0451c8fb4a82ffa135c976caac46e60849c0c15051f6c13a39","observation_id":"3b4dce1b-f7c7-4325-be3c-9a034494d533","resolution":{"observed_at":"2026-08-10T23:12:20.440398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.419773Z","title":"Settings","venue":null,"work_id":"ab582da4-79e0-4b20-91a0-166fb60147e8","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.119440Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:3a06351fdde04717c15c6342cd327f82ae1f564ce93dc3f207555871ed775f8e","observation_id":"208f177f-c8cf-4588-ad7f-d43ff41a5f15","resolution":{"observed_at":"2026-08-10T23:12:20.424697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.403822Z","title":"Data Regional Distribution","venue":null,"work_id":"91df80e0-3d84-4316-a545-aee211724f66","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.124301Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:9d28392903abed2c5c3d60ca60da4269b3814e6abf9135d11311b7ee1644debb","observation_id":"ee4558f7-83a7-4b78-8b07-ab37183f39c9","resolution":{"observed_at":"2026-08-10T23:12:20.408918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.387926Z","title":"All Prompts Used in Paper","venue":null,"work_id":"0b1cdbc8-d6dc-4bfa-b4f0-8b0884c3bdc1","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.129337Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:75eff353fc8ad08831743a96dc9f292deeffe4afc3aa4c2cdcc4d2a7d3737d62","observation_id":"323e987c-e72f-4fb1-9a4d-d7b1db7a0116","resolution":{"observed_at":"2026-08-10T23:12:20.393059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.371972Z","title":"Visualization of Hierarchical Reasoning","venue":null,"work_id":"edca35e8-399b-4a9d-83b7-2dc8624d0328","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.134086Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:38b24d137576e0611625e804372886166ae65fa6d91f8d68fe1fa2c53e76530c","observation_id":"2eacb0a7-3f6d-40dd-85dc-8a378aab14c9","resolution":{"observed_at":"2026-08-10T23:12:20.377270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.356011Z","title":null,"venue":null,"work_id":"86d805cd-52a9-4ee1-bd93-4603052dec05","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.138813Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:daf827e61a182a23eac027754302c4984d1588e59f9b335e6a9b5716d49a8d2d","observation_id":"172be62c-3674-413c-b5cb-dac19ceb2675","resolution":{"observed_at":"2026-08-10T23:12:20.361647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.339883Z","title":"Data Regional Distribution Table 8 shows the data distribution and corresponding du- ration in the W AD dataset","venue":null,"work_id":"24232027-90bd-4c20-8840-c5c4e5065c94","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.143806Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:a2dea4f63ca31517894b5dcf0c22bff449e35b0d2515c485363e53e7d8aec4b4","observation_id":"bb27a21c-ccb4-4c38-94de-6bf77db81f66","resolution":{"observed_at":"2026-08-10T23:12:20.345168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.324701Z","title":null,"venue":null,"work_id":"554dfaad-bacd-4116-bc51-c7b6936666d2","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.149242Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:945b81936cee06a09e3ed97eb8f8c8870a4b651c6925d67d492bceb70d68edaf","observation_id":"20ba17d5-aa53-435c-8643-3be40a57bafb","resolution":{"observed_at":"2026-08-10T23:12:20.329328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.308776Z","title":"Visualization of Hierarchical Reasoning We have demonstrated the results of hierarchical reasoning using WalkVLM in Figure 18","venue":null,"work_id":"010162e9-fee8-475a-be01-44fe5b061dc6","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.154319Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:39b0df99f62b778c7fdb25c9e55bba2dc9f6b3f643cc8994abfec2648a26c6b7","observation_id":"fa53ddef-f093-4a0a-b1a5-9926a7cde868","resolution":{"observed_at":"2026-08-10T23:12:20.314321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.292909Z","title":"The visualization results of the two models on the video stream can be viewed here, where WalkVLM is capable of generat- ing less temporal redundancy","venue":null,"work_id":"66812807-ca28-4edd-b57a-ee561c6e937b","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.159537Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:8142b61205d9a1d88795ecb62c44057fb99d4fb47dcbcca754c3809a1a2e19fa","observation_id":"a06e5a22-9cee-4f47-a61a-b024effe1e81","resolution":{"observed_at":"2026-08-10T23:12:20.297847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.277672Z","title":null,"venue":null,"work_id":"20398a5f-18da-40c2-828e-fe84e6527240","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.164646Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:ccbea2871974f335c6d7b8d2d59e63a96638e34b82e839098f1fae27bd33262c","observation_id":"37e46d0e-1bad-4d67-8f60-99c84c59ef01","resolution":{"observed_at":"2026-08-10T23:12:20.282670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.261331Z","title":"1. Location","venue":null,"work_id":"5cc819f1-75bb-4050-8a03-d43d1ab603d1","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.169791Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:1075b732be69a35540d65e24563d425e6be96498ba928d83efeebc79ee10d32f","observation_id":"af84912f-5a7a-433f-afe7-cad67856ffe1","resolution":{"observed_at":"2026-08-10T23:12:20.267241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.246040Z","title":null,"venue":null,"work_id":"077a584b-66f4-4972-a4d9-31ac78852684","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.175365Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:5a59e881834525ba561ff0ec482df203c8aee224a0ada4e45ce65aa3d0bd2a92","observation_id":"9860899e-e4ab-4aaf-8f45-213fcca8c135","resolution":{"observed_at":"2026-08-10T23:12:20.250862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.231745Z","title":"This entrance is marked by a structure with glass doors and an overhanging roof","venue":null,"work_id":"b3c10c8b-4555-43eb-8b6c-d440a7196254","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.180203Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:38654017524d9d3ce93bd1fd617f7789d2ca4d8a82ebf086539a8439e6b4d287","observation_id":"3ce6d488-b984-430c-9e2a-0b319af98de4","resolution":{"observed_at":"2026-08-10T23:12:20.236242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.216207Z","title":"The pathway is paved and flanked by plantsers filled with lush green plantsings","venue":null,"work_id":"b2e60631-f5ac-4a9a-b988-8a56ddc71764","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.185566Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:8261f539a7c346cfc9e3767cb209eec6a3b12700f17c11c7f437f8299e73d8e6","observation_id":"e8f45a7d-568f-4b97-9012-6880c5e70639","resolution":{"observed_at":"2026-08-10T23:12:20.221192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.197870Z","title":"Walk under this structure to shield yourself from potential sun exposure or weather elements","venue":null,"work_id":"3465fdf2-28d4-49e1-b0e3-c7dbb096999b","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.190374Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:6241810c646fb13aaa75485903d13823a7a2ca9cccc86b5aa626e1e9b5996e3b","observation_id":"79f39e30-9d6a-4402-a2eb-0c809a038457","resolution":{"observed_at":"2026-08-10T23:12:20.203675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.182252Z","title":null,"venue":null,"work_id":"a42f1045-ff34-4832-ac7a-17d398b4182e","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.197218Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:683e02acec67c8163af550550f89441250db4e489ac3cb08a03ea97afec4f5c5","observation_id":"283ea936-fbee-4e09-8d80-a9c6edec8857","resolution":{"observed_at":"2026-08-10T23:12:20.187375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.163948Z","title":"The path is clear and unobstructed, with a slight curve to the left","venue":null,"work_id":"cbe06b9a-5268-494c-96ef-11d339e4ecb5","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.203763Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:4919a78a3e913f88acd3a2b122a98c751d8b133cb10507214afb8e68ca59ed62","observation_id":"b44c0be8-ded3-4f12-9e74-5f24fcaf0fc6","resolution":{"observed_at":"2026-08-10T23:12:20.171549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.145767Z","title":"On your right, you will see a staircase and more greenery","venue":null,"work_id":"c0e9d6ee-94ca-4a2d-bf40-fb448aadc718","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.209235Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:7c8c14657659fe7f6ee605d4d216e9e7dc8063e179fbfae74b5125bcf69b46d5","observation_id":"8bb3ad1d-60b2-4ad8-8fd1-f60c292bcf45","resolution":{"observed_at":"2026-08-10T23:12:20.151684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.129528Z","title":"Toastbox","venue":null,"work_id":"85b23e7b-388d-4ebb-83ab-2c90ad4ccd61","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.214742Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:8f1d5a88be7314c5c5e211639358c89ebf866772656e00807450251e773bc767","observation_id":"7ed549b4-8e17-4cb5-8968-1a8d06ad997c","resolution":{"observed_at":"2026-08-10T23:12:20.135501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.113977Z","title":null,"venue":null,"work_id":"25ae0a2b-6fa1-439d-809f-9280258cc477","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.219744Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:1ca5a2028e19b4932d587ebfddf67d9d0b9115c4b3ccb9e392db6bed7e187c50","observation_id":"783f67ff-4669-4a45-bcf3-171f5ba4d485","resolution":{"observed_at":"2026-08-10T23:12:20.119015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.098444Z","title":null,"venue":null,"work_id":"b486465a-efa3-4de6-97b3-361e120266ad","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.224589Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:fff041be863976487ecb4c24e7070204d4fa967de79f926d105e494d9afd25bc","observation_id":"4b1488c1-2a4e-4e83-9e3e-29deea4b7314","resolution":{"observed_at":"2026-08-10T23:12:20.103333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.082640Z","title":"Whole Earth","venue":null,"work_id":"ae1da49b-1770-4828-8d43-04dadd642fd0","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.229541Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:eb9ab53fd36ca25cb6d92d8494d1d88c44e2509dac23e3f193976eaaee98d501","observation_id":"dadcf5f0-fde6-46ad-b493-2a554acda2e1","resolution":{"observed_at":"2026-08-10T23:12:20.087877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.067330Z","title":null,"venue":null,"work_id":"e8c76ff7-10bc-4022-b635-a163d878574d","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.234461Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:2607939727a6bda72baf86b4fa276270e3602fef7fcc03e5a86394506b77c57d","observation_id":"6ce7f705-b099-4f8d-b1ac-eb9a9b4bbd76","resolution":{"observed_at":"2026-08-10T23:12:20.072030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.050717Z","title":null,"venue":null,"work_id":"c9b0da99-111e-4f66-b4b4-eb66f3db25b4","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.239320Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:354f270073448d0e8eab4f6f5d6541590022f0395e7770a32a16a813fefa9720","observation_id":"4d16c5ed-075e-486e-9292-9029ae59ca52","resolution":{"observed_at":"2026-08-10T23:12:20.056663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.033244Z","title":null,"venue":null,"work_id":"5e8217e4-8de2-419c-88ae-1ee5f343c5eb","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.244331Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:d17db85f15d396d3b227e04547ba6dc28c04134e12c83789a92ab33f5ebe475d","observation_id":"ca414976-e03c-48f5-8ff6-4bb5db3de7b2","resolution":{"observed_at":"2026-08-10T23:12:20.038850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:20.014015Z","title":"By following these steps, you will be guided through the urban environment shown in the video, ensuring you stay within pedestrian pathways and avoid traffic lanes","venue":null,"work_id":"a4f42557-191b-4d89-825a-1cd789ccc886","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.249307Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:d00ad8df4b503fbb7bc95dbfa1da8bc7f6624309f6cdaeea250fb2173ffacc64","observation_id":"9ec88863-9efe-4e47-bef3-af0badb6e14f","resolution":{"observed_at":"2026-08-10T23:12:20.020292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:19.996831Z","title":"Whole Earth","venue":null,"work_id":"0565f9c3-df1a-4e5e-b914-2df1209b3118","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.254009Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:53fb1c616bca9d9f2bb14133578e5e7deb4a8ff96144371a4e9f8ce8e7d76156","observation_id":"66c3703b-ff16-47fe-81d6-402951b2fcf0","resolution":{"observed_at":"2026-08-10T23:12:20.002662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:19.980463Z","title":"Do not step onto the road","venue":null,"work_id":"cef62168-f718-4fc8-9b8c-ea9d6f9ec28b","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.258853Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:e4d6fcb28a1923a243ebac3b8677a9e35f874c63c124f30d62421ccaa9dc2bca","observation_id":"41adabdc-b30e-4d69-a260-18111e696262","resolution":{"observed_at":"2026-08-10T23:12:19.985365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:19.964463Z","title":"Ensure that you check for oncoming traffic from both directions","venue":null,"work_id":"1bafa862-4f28-4f96-8a43-78fc2a83c6d9","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.264062Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:298f2c5a9b4e5d5f1186d9cf044dcb9f6c363e0ea6defe71ab053efed2f7b9d1","observation_id":"b6ee6707-7d2e-499c-bc81-7aef21a4e80e","resolution":{"observed_at":"2026-08-10T23:12:19.969653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:19.948464Z","title":"Whole Earth","venue":null,"work_id":"38cf339e-8d0c-4970-8b7e-49e642a58af0","year":null},"citing_paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:19.269126Z"},"links":{"citing_paper":"/paper/2412.20903"},"observation_digest":"sha256:d46e1c4f5c4e8d26e8e5147aa4e0a313f66b192910fff392ac981f86d57e550f","observation_id":"b5c07023-2a10-4657-a6f6-c5acdff74cb7","resolution":{"observed_at":"2026-08-10T23:12:19.953323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20903","last_updated":"2025-03-04T15:05:02Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T15:19:19.015706Z","submitted_at":"2024-12-30T12:29:02Z","title":"WalkVLM:Aid Visually Impaired People Walking by Vision Language Model"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 3 inbound Pith citation observations for arXiv:2412.20903."}