{"as_of":"2026-08-18T19:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12bc54094895f187f393830ece1f3adec0d1fc92d2702df42aff06a1a957e31d","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:31:00.288054Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18027/citation-record","integrity":"/paper/2504.18027/integrity","json":"/paper/2504.18027/citation-record.json","paper":"/paper/2504.18027"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:01.021278Z","title":"Ingold, The perception of the environment: Essays in livelihood, dwelling and skill","venue":null,"work_id":"2d6712a8-fb69-43b5-aa3e-5852b7a7645f","year":2000},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.070592Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:66661b0ea04f40d0693d5e3254290dbc1ab59a4bc3d4e29d2fb349b8f77795f6","observation_id":"5238b3ec-0889-4319-9ec4-254728d96961","resolution":{"observed_at":"2026-08-16T10:31:01.025469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:01.008942Z","title":"Enabling independent navigation for visually impaired people through a wearable vision-based feedback system,","venue":null,"work_id":"befe3473-60f0-4f13-adc3-532b1ecb2ea5","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.075930Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:fdfad289a99253baf5ad44196386ad0bb2b58db74da5d372e5f0d1dd5261722b","observation_id":"ca42d922-1ed1-460b-bb85-b2b5985e29fc","resolution":{"observed_at":"2026-08-16T10:31:01.012861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.997274Z","title":"Magnitude, temporal trends, and projections of the global prevalence of blindness and distance and near vision impairment: a systematic review and meta-analysis,","venue":null,"work_id":"207ac1d9-9802-4976-a796-01ebc2454337","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.080180Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:07aac25f2c9be9709c9bdb09560d4b42ccd48b9d77170a4fcc861a7b80d3cc29","observation_id":"81703b36-5f97-486c-8024-ba29eec7ec0c","resolution":{"observed_at":"2026-08-16T10:31:01.000856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.985201Z","title":"Objectively measured visual impairment and dementia prevalence in older adults in the us,","venue":null,"work_id":"6520999b-0f72-4d88-a0be-b79c0d99e036","year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.083756Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:eaec0f472088d3ffe74fc01846d4733058bf5660b41de9746a9cc6ac5bfd6b3d","observation_id":"84177a55-74ac-4142-a187-32e566d797ca","resolution":{"observed_at":"2026-08-16T10:31:00.989233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.972386Z","title":"Virtual-blind-road following-based wearable navigation device for blind people,","venue":null,"work_id":"3644af8a-f8a3-414d-a747-e16609270499","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.087535Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:d882e3b794399886ff6bc12593fe66e62e6d890adc7e7cbd10f348d050dd359e","observation_id":"4239bd43-dd8e-4050-8236-e43af278c429","resolution":{"observed_at":"2026-08-16T10:31:00.976446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.958464Z","title":"Embedded reading device for blind people: A user-centered design,","venue":null,"work_id":"96e354d0-f3ab-43da-bbab-8bfaaa3f0080","year":2004},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.091100Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:de80e2be80ebdbe24cc0cd77a35c550ec911639a843987f1f616ac41f9643803","observation_id":"53098e2a-d256-4c56-90fd-bc8e9a837140","resolution":{"observed_at":"2026-08-16T10:31:00.962539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.944897Z","title":"Hand-priming in object localization for assistive egocentric vision,","venue":null,"work_id":"b5e7acab-675d-413c-bf7d-3b0df5e3ac7c","year":2020},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.095164Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:6ffce4fcdc43e90cca004adfe637b5fa243cbef6fb028d165ff4bec0cfdd0cb7","observation_id":"0e357f4a-6a50-41a8-ab36-4d3cf8eb07d8","resolution":{"observed_at":"2026-08-16T10:31:00.949264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.931734Z","title":"Vizwiz-fewshot: Locating objects in images taken by people with visual impairments,","venue":null,"work_id":"3d5f491e-54cc-4be9-a671-ab2521ef9eba","year":2022},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.098659Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:cb8785698917093b5723282a80d3250ae518f0638ea20af7d24de9a085c4719c","observation_id":"7586210f-3cae-425b-a8ab-3aad3216f4e5","resolution":{"observed_at":"2026-08-16T10:31:00.936168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T10:31:00.102041Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.102041Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:894533b299fe038c6ca0a7c88e4afade48d4c5f5041e2bffacca424ddd995472","observation_id":"b8897f6e-bdb0-4ec7-922a-ecd80845d349","resolution":{"observed_at":"2026-08-16T10:31:00.102041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02745","last_updated":"2019-09-06T07:20:17Z","snapshot_observed_at":"2026-08-18T01:48:03.419159Z","submitted_at":"2019-09-06T07:20:17Z","title":"Incorporating External Knowledge into Machine Reading for Generative Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02745","snapshot_observed_at":"2026-08-16T10:31:00.105795Z","title":"Incorporating external knowledge into machine reading for generative question answering,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.105795Z"},"links":{"cited_paper":"/paper/1909.02745","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:75bb8083f70f61a7c622ad5f0ae3e484de151d364ce7a772af08285203b8ea83","observation_id":"8362b807-6bb6-49bb-a64b-4545ea3c38fa","resolution":{"observed_at":"2026-08-16T10:31:00.105795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12813","last_updated":"2023-03-08T23:41:49Z","snapshot_observed_at":"2026-08-16T13:28:02.541688Z","submitted_at":"2023-02-24T18:48:43Z","title":"Check Your Facts and Try Again: Improving Large Language Models with External Knowledge and Automated Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12813","snapshot_observed_at":"2026-08-16T10:31:00.109472Z","title":"Check your facts and try again: Improving large language models with external knowledge and auto- mated feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.109472Z"},"links":{"cited_paper":"/paper/2302.12813","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:7b577318ac13efe95602abcdae0012644323535ffb9292f42040c1b985b3ccd5","observation_id":"7793f1ca-80db-4d2b-bdc9-aacadb2ff268","resolution":{"observed_at":"2026-08-16T10:31:00.109472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.918589Z","title":"Smart guiding glasses for visually impaired people in indoor environment,","venue":null,"work_id":"55364d79-9ae9-49aa-914a-f6181a473f67","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.113421Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:fd8c4510ed30d2aba63bebdd13ccfa22e73d20f49b9eeeedaaac36e47bfa5deb","observation_id":"6c32a6fa-7e82-4595-9138-59c04d5d0d6e","resolution":{"observed_at":"2026-08-16T10:31:00.922921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.906013Z","title":"An enhanced obstacle avoidance method for the visually impaired using deformable grid,","venue":null,"work_id":"4c8ee9d6-3b89-4331-b8df-0f71a5833a6e","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.117676Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:35d8c0a8c5340f48adebfcbd6002869330e533640654d8d99c05a5c0b63b478a","observation_id":"476705bc-afe4-4c72-85e4-c95e66a421d9","resolution":{"observed_at":"2026-08-16T10:31:00.910049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.892737Z","title":"Collision detection method using image segmentation for the visually impaired,","venue":null,"work_id":"bc7d402f-d506-4381-a6b2-9c4ab8c9c6d8","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.121663Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:500326c5e95ee51e23d49ada79f8d7cbbf954ae3ad5829c75283820cf83e6900","observation_id":"4131347c-bc28-441d-8b39-f54f3886c515","resolution":{"observed_at":"2026-08-16T10:31:00.897088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.880508Z","title":"Tdraw: A computer-based tactile drawing tool for blind people,","venue":null,"work_id":"206e382a-3c72-43ca-9c68-0480112ba80e","year":1996},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.125470Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:a803bf0065c4bd4cc576edf16079e906fad572b37887b571751d089a00ce113e","observation_id":"2f7d754c-8d43-45c7-aac0-9c60342808ac","resolution":{"observed_at":"2026-08-16T10:31:00.884312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.868813Z","title":"Usable gestures for blind people: Understanding preference and performance,","venue":null,"work_id":"e1f0cba6-c5c5-4dd1-950e-b420d6b9998e","year":2011},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.129243Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:85dfcdff3b72b842a7d3a548e8d3a8bac7ffa2a8dd520f27c718110d57436adf","observation_id":"6c449d9b-0b3f-4423-bd65-fe56bd35dabe","resolution":{"observed_at":"2026-08-16T10:31:00.872328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.856515Z","title":"How teens with visual impairments take, edit, and share photos on social media,","venue":null,"work_id":"e7e274be-17ce-47af-a7cb-4891d42b25fd","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.133075Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:fb7063bf8993e29704948c5c2d0af1c783ab66fcc9d2f7d1b904b1bf29b270ca","observation_id":"a716678e-67de-4f5c-84de-4918c397b659","resolution":{"observed_at":"2026-08-16T10:31:00.860378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.843323Z","title":"Flight: A low-cost reading and writing system for economically less-privileged visually-impaired people exploiting ink-based braille system,","venue":null,"work_id":"36875663-3eb8-4b8b-b05c-09f937150632","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.136838Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:8234928ee3966b9dd2ad43b605e06ca87c7ccc6d7ac317acc9a602ebc9ff0018","observation_id":"9f894f49-d49e-4c92-9fbd-8845beb8ba1e","resolution":{"observed_at":"2026-08-16T10:31:00.847723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.830481Z","title":"Linespace: A sensemaking platform for the blind,","venue":null,"work_id":"1f684bcc-9077-4078-82b2-ac4ca18304e6","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.140734Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:82f352550100f794f2879152ef1044bf5983d0c45dde1b5bab31ecc08ef9383b","observation_id":"5f6859ed-659e-41b2-af1e-c7fe1ff43ee5","resolution":{"observed_at":"2026-08-16T10:31:00.834865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.817478Z","title":"Tangible reels: Construction and exploration of tangible maps by visually impaired users,","venue":null,"work_id":"604dfcdd-ae30-404d-8886-64a0c68c6fee","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.144554Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:7c0495a006a92e4633656a21ec55783a7f812ed931ba2e5d2d69cfb58c1d8793","observation_id":"8ab3b6b7-2fae-428c-94a4-91c5f5189655","resolution":{"observed_at":"2026-08-16T10:31:00.821638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.803987Z","title":"Comparing computer- based drawing methods for blind people with real-time tactile feed- back,","venue":null,"work_id":"c43dd342-be1e-4049-875c-bf10db6a87db","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.148569Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:5eaa0921b1937db4d79adfba4d8a3445324608b1ef0bc17331292a1f212cf888","observation_id":"2745375e-50b7-476d-bfe5-2047884835fc","resolution":{"observed_at":"2026-08-16T10:31:00.808129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.790897Z","title":"Accessible maps for the blind: comparing 3d printed models with tactile graphics,","venue":null,"work_id":"abfff37c-7cf9-4470-8891-0619660b96d3","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.152475Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:ce9645b1df5f3c99132ea0fb4f425b35c8af2bcc25d220541f299e04036ed77f","observation_id":"ee460e25-8e79-460d-9ac2-3ffa77a00f2f","resolution":{"observed_at":"2026-08-16T10:31:00.795103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.778209Z","title":"Taking into account sensory knowledge: The case of geo-techologies for children with visual impairments,","venue":null,"work_id":"7197721b-5213-4654-91e3-24b9e810ac6c","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.156325Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:0e53252dffe9c8de14c04224718ed4e488d9c2870cf30fd292f2b1afe119e370","observation_id":"4f9b320c-d7ba-45bf-b420-4a433b9245b0","resolution":{"observed_at":"2026-08-16T10:31:00.782295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.765678Z","title":"People with visual impairment training personal object recognizers: feasibility and challenges,","venue":null,"work_id":"5a36451e-442d-4593-8dc1-d7e5a9514db3","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.160306Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:6ef06a583ee722589227d2e70aedec203865d12a93fa8705b902678b3d8ad666","observation_id":"2c4c0c9f-7df3-4901-bf1b-846fbdbee5cc","resolution":{"observed_at":"2026-08-16T10:31:00.769894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.752924Z","title":"Synthesizing stroke gestures across user populations: A case for users with visual im- pairments,","venue":null,"work_id":"8dd65ff5-c9f3-46dd-a3da-e58701372f39","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.164179Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:978eec67662cc69c3e97e64d890432b93dbcc7f9454c98322be19a9045e15294","observation_id":"2d119cea-d298-4215-973f-999cd590083f","resolution":{"observed_at":"2026-08-16T10:31:00.756993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.740497Z","title":"A face recognition application for people with visual impairments: Understanding use beyond the lab,","venue":null,"work_id":"c8afd332-cedd-42db-baaf-0cef7e1de1a4","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.167995Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:15212bcda8ad2d764120b905b9c71cb44f6b2ece59eaa1d22aa0323ae9a895f7","observation_id":"5a758cf3-9155-4672-9e47-5c8ec60709dd","resolution":{"observed_at":"2026-08-16T10:31:00.744620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.727891Z","title":"A multitask grocery assist system for the visually impaired: Smart glasses, gloves, and shopping carts provide auditory and tactile feedback,","venue":null,"work_id":"49a60959-e936-4119-b490-177bb748a62e","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.171921Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:f6064ae593aa95c8b1b011153d0bd5103862daabdc566f7ed3fa0ab216501eaa","observation_id":"96ec5311-e479-40ed-ba47-8d60998fa60b","resolution":{"observed_at":"2026-08-16T10:31:00.731875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.715426Z","title":"Hindsight: Enhancing spa- tial awareness by sonifying detected objects in real-time 360-degree video,","venue":null,"work_id":"c8dfa977-8f97-4d86-b79f-a5a8df745e8d","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.175848Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:963a3521ff5216cbe4332041ee729ca37ef98e649a1358e6cb97e18fe355cc86","observation_id":"6b9f7371-ff12-4baa-af1e-4f1a343d138a","resolution":{"observed_at":"2026-08-16T10:31:00.719664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.702333Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":"6c186df6-5652-4465-84cb-e8f141337665","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.180050Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:05e97d2b0a36036f8b81cba0c349f94fd760858a5535809249edab13ccb47029","observation_id":"66c24848-801b-43a9-bba2-e0ddc698e84d","resolution":{"observed_at":"2026-08-16T10:31:00.706770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.688635Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":"3b16e757-fcd0-440e-a114-dca514ec29e8","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.183925Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:1edbbe565ac0c7adabd8c0c6819c5a125d2def46525c8d76879265834a2ad28b","observation_id":"782940ce-8c74-4448-bfb2-673331de9336","resolution":{"observed_at":"2026-08-16T10:31:00.692788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.674655Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation,","venue":null,"work_id":"ed624bdd-2959-4500-aa9a-1deafaea0605","year":2014},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.187686Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b8e31c87fb83b6ec65e8cda1a0321c9e724fe5a7c5c967586c1925714c71c8da","observation_id":"2ee8d73a-286f-4d23-b07d-2e3cb947d673","resolution":{"observed_at":"2026-08-16T10:31:00.679459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.660920Z","title":"Faster r-cnn: Towards real- time object detection with region proposal networks,","venue":null,"work_id":"5be4e6bd-3e99-44ec-b949-8cf700b87ebe","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.191599Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b17a57800f9dfca579f02d96c681ce778c17b8f81e45198a55070ee81196c9ec","observation_id":"db88033f-d8b6-4980-86b5-a4533595940e","resolution":{"observed_at":"2026-08-16T10:31:00.665125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.648452Z","title":"Fully convolutional networks for semantic segmentation,","venue":null,"work_id":"63d82340-7aee-4863-9447-852137dcac0f","year":2015},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.195421Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:24bcd46b7e5553796e57d890b0e4b10247aa6fbf02ee4fcdca8546de576c13d7","observation_id":"a194552c-df25-496f-8c23-442091595cf6","resolution":{"observed_at":"2026-08-16T10:31:00.652065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.636738Z","title":"Segnet: A deep convolutional encoder-decoder architecture for scene segmentation,","venue":null,"work_id":"cc8adc96-177c-44cf-9650-3a5ac9d24c18","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.199320Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:767d157d29cd5590c4af50a8bd344e1a7a9d74b8ba712a3694df79c46f56a6dc","observation_id":"cd9f58ff-1615-4cc4-a81e-1e7964239d26","resolution":{"observed_at":"2026-08-16T10:31:00.640256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.624791Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,","venue":null,"work_id":"ca2784a4-6265-423b-ba6a-dcf4fdcc25d6","year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.203093Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:4646d5b1910c5bd11ee7e3752385d7b4b0f6bcc1e6d34e318694609a0e8d9251","observation_id":"a944ebca-3c19-4ccc-9772-cbc211c6bffc","resolution":{"observed_at":"2026-08-16T10:31:00.628702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.612669Z","title":"Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers,","venue":null,"work_id":"007c46f2-39b8-48cd-acaa-02dd9402f848","year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.206866Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:96c8d5abb04ecd6b66882d62c3c9af89431a91d3c7fcdbf76984168a89a33650","observation_id":"9150d598-d671-489d-9a03-c988fa2185f2","resolution":{"observed_at":"2026-08-16T10:31:00.616863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.210929Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.210929Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:0aa072a76d13c748e24826bbcc6686a2120050ff3a67aefe4c2a732faf58803a","observation_id":"f05c32a9-1f5b-4acf-8032-411eef2c3f9c","resolution":{"observed_at":"2026-08-16T10:31:00.210929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.214911Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.214911Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:1aab207d8b34b1d349085373fef4663238a411813a816c2a32051ee777f7b0c9","observation_id":"f399b1a3-0bdb-41c3-b49f-62bc9b3321ba","resolution":{"observed_at":"2026-08-16T10:31:00.214911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.584097Z","title":"Fusenet: In- corporating depth into semantic segmentation via fusion-based cnn architecture,","venue":null,"work_id":"c6ad60a8-46e2-4b89-aa59-635a20f73bc0","year":2016},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.218978Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:b430d076b66704a9b0bc7a01491b5111740e9a0d36baf4ec6563436804e40339","observation_id":"dc472b25-ca38-4440-bc89-769d0e8f45b2","resolution":{"observed_at":"2026-08-16T10:31:00.588242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01054","last_updated":"2018-08-06T17:11:25Z","snapshot_observed_at":"2026-08-14T19:07:52.788158Z","submitted_at":"2018-06-04T11:33:57Z","title":"RedNet: Residual Encoder-Decoder Network for indoor RGB-D Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01054","snapshot_observed_at":"2026-08-16T10:31:00.223131Z","title":"Rednet: Residual encoder- decoder network for indoor rgb-d semantic segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.223131Z"},"links":{"cited_paper":"/paper/1806.01054","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:946527802615d199ae8d42f757cdbd37d423e2eff93dc28ab4805dcc97c88266","observation_id":"ff2e631d-caab-4573-9575-50ff1d525f6c","resolution":{"observed_at":"2026-08-16T10:31:00.223131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.571138Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":"1daa2c3c-83df-4f3a-b12f-58f486b047ea","year":2015},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.227421Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c4e7bfe3d501ab50afae7e3f372b5d5111e7ac3e7c8ebdcaddfdc8c08b2a2758","observation_id":"740e6dea-7417-46aa-b70a-34ceda40eef0","resolution":{"observed_at":"2026-08-16T10:31:00.575223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.557706Z","title":"Knowing when to look: Adaptive attention via a visual sentinel for image captioning,","venue":null,"work_id":"c4bf632d-f560-4a06-8639-f762520ac315","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.231212Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:7874986fd1d90a942b0f21ef1300aaac0501d0c1698e64cca4d2ebf69785debb","observation_id":"c8b8e99b-6775-45f8-9922-73d45b06afb5","resolution":{"observed_at":"2026-08-16T10:31:00.561847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.235162Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.235162Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c8ae33d5ecb821a846ee54728278e0cb53e21f004def0e30e82b819039d67165","observation_id":"b953f83a-e732-4730-9bd1-1cee6bfa1a0e","resolution":{"observed_at":"2026-08-16T10:31:00.235162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.536464Z","title":"Dense captioning with joint inference and visual context,","venue":null,"work_id":"10b86934-777f-4b5b-850b-526bffb1a9ac","year":2017},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.239060Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:226dbf3922f50b073fd298dfbf251f0dfe5da1d1e3c108df2d03f8ef7c36e666","observation_id":"cc6bd0fe-de3c-42c2-8f77-dbe17d3ac78a","resolution":{"observed_at":"2026-08-16T10:31:00.540912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.243006Z","title":"Unifying vision-and-language tasks via text generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.243006Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:bdb97ba6b93e31289d5b68f37290959a80d2b98079b4911fe2fceac54ab2702c","observation_id":"2964a558-64f0-4877-926c-80e27e40cccd","resolution":{"observed_at":"2026-08-16T10:31:00.243006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.514586Z","title":"Multimodal few-shot learning with frozen language models,","venue":null,"work_id":"e1fe8e8f-8969-4982-aa40-deab1a0048a2","year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.246908Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:9cea2d97903d962a927c810abfb96861b5f02413f6a7d6c10ceb4c76cd731e65","observation_id":"a970cb18-308b-40d8-8047-b79c31476024","resolution":{"observed_at":"2026-08-16T10:31:00.518885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-18T03:59:28.575532Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-16T10:31:00.250761Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.250761Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:c7383d6ce69b38b06fffffcc683f1f183b7bba05814f3c7a56f47892426e327c","observation_id":"defa57c1-c932-44b8-b1d4-1991733ba014","resolution":{"observed_at":"2026-08-16T10:31:00.250761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.254925Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.254925Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:1fc50c6de06e156f7b81501ba2bb06160c0a14b918a00898d750f7dcfdec86c3","observation_id":"3618de6a-eedf-4b2d-b03a-ce85522cbad0","resolution":{"observed_at":"2026-08-16T10:31:00.254925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-16T10:31:00.258268Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.258268Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:5a71f898e5984d22fde4eeb0d14ca2924892007628a3d869199ab88ff735dd2f","observation_id":"73657ceb-f69e-4b10-ac8f-332c7648fdbf","resolution":{"observed_at":"2026-08-16T10:31:00.258268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.492285Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"c765eaf8-9e9a-4b28-911b-b90c0ee941a8","year":2022},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.261705Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:2982fa04c56e17d1fada91a7329485a17f2ae5c913cdc5d49527b00312d0f8db","observation_id":"ced62b91-54c3-45b1-9e08-05e7e56ae140","resolution":{"observed_at":"2026-08-16T10:31:00.496661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06394","last_updated":"2024-02-11T08:38:07Z","snapshot_observed_at":"2026-08-18T12:58:26.782246Z","submitted_at":"2023-08-11T21:35:20Z","title":"Detecting and Preventing Hallucinations in Large Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06394","snapshot_observed_at":"2026-08-16T10:31:00.264996Z","title":"Detecting and preventing hallucinations in large vision language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.264996Z"},"links":{"cited_paper":"/paper/2308.06394","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:72c9ac0b277f15cbc64de5e67235787224944141ae2d5fb7fbd697d28a25f940","observation_id":"f9486fcb-4b5a-4fea-b769-c90404a7b5a3","resolution":{"observed_at":"2026-08-16T10:31:00.264996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-16T10:31:00.268434Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.268434Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:e3f11f892ef997bb4edeba2c72728ec82c349c96b2379d02f772a3c69dc27c2f","observation_id":"34c754b0-afdb-4e51-8015-78cbd4d6f1ad","resolution":{"observed_at":"2026-08-16T10:31:00.268434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04041","last_updated":"2024-01-13T03:02:12Z","snapshot_observed_at":"2026-08-16T15:02:23.936376Z","submitted_at":"2023-09-07T22:59:56Z","title":"Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04041","snapshot_observed_at":"2026-08-16T10:31:00.272098Z","title":"Evaluation and mitigation of agnosia in multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.272098Z"},"links":{"cited_paper":"/paper/2309.04041","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:2d768d18d7749328d4136f8a215c3a2870772cc52cee74cec436161eff23abe1","observation_id":"c50934a6-876e-45e6-8396-b10a0d94a28d","resolution":{"observed_at":"2026-08-16T10:31:00.272098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-18T12:54:07.136498Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-16T10:31:00.276120Z","title":"Woodpecker: Hallucination cor- rection for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.276120Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:aa736369241794b902004b1f30181d6a569a04250198814a60b03339a7431b5a","observation_id":"bbbcd020-b0fb-4e83-bc27-793dbb5472e9","resolution":{"observed_at":"2026-08-16T10:31:00.276120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:31:00.476853Z","title":"Qwen-vl: A versatile vision-language model for under- standing, localization, text reading, and beyond,","venue":null,"work_id":"dc597937-a2f3-4f79-bf97-a0f8f880de7e","year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.280139Z"},"links":{"citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:a942171a1941f1eb6b4481c91f9a2607ed29f1968c2a1050edad03423216f9a8","observation_id":"ea7e7403-23df-49dd-ada6-ca04bb3f694c","resolution":{"observed_at":"2026-08-16T10:31:00.482844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-16T10:31:00.283944Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.283944Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:e231fb24f22d50899bd25a376eece29e5191a014ebe1051ea3fe07bcf6ed845b","observation_id":"d2610f5d-784e-4134-b3e9-d6f8c114c06b","resolution":{"observed_at":"2026-08-16T10:31:00.283944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T10:31:00.288054Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T10:31:00.288054Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.18027"},"observation_digest":"sha256:77226cef43530e81bc5a81402b98490a9c7571a9fdcc2eafdc741acb723ae7a2","observation_id":"41a2c272-c971-410a-a7a6-7bb40030c138","resolution":{"observed_at":"2026-08-16T10:31:00.288054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18027","last_updated":"2025-04-25T02:46:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T05:33:35.492963Z","submitted_at":"2025-04-25T02:46:22Z","title":"A Large Vision-Language Model based Environment Perception System for Visually Impaired People"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2504.18027."}