{"as_of":"2026-08-08T02:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e15d73ad8118879ebe0425c3873e916c9b3773cd3e87c87774f8dd1ce2e2436","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T17:13:04.236686Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.09142/citation-record","integrity":"/paper/2606.09142/integrity","json":"/paper/2606.09142/citation-record.json","paper":"/paper/2606.09142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Pedestrian Behavior Prediction Using Deep Learning Methods for Urban Scenarios: A Review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:023d94231a86550ab7d18d56eeff3a43f6edf9bc1e437be93db38841b0fb1d3d","observation_id":"b3b16424-1d11-4892-a331-214cc0b4fcae","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Predicting Pedestrian Crossing Intention in Autonomous Vehicles: A Review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:0ca77096fd7de7d1e0705537929466cb96fb0bd72d4ab64275e66e0ab7f776d0","observation_id":"bed714ee-335a-474a-9ccf-df0bec14183d","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19026","last_updated":"2024-08-07T05:54:04Z","snapshot_observed_at":"2026-08-06T11:06:44.227248Z","submitted_at":"2024-03-27T21:43:12Z","title":"EgoNav: Egocentric Scene-aware Human Trajectory Prediction","version":3},"cited_work":{"arxiv_id":"2403.19026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19026","snapshot_observed_at":"2026-07-03T00:27:29.691663Z","title":"Karen Liu, and Monroe Kennedy III","venue":null,"work_id":"62530d50-4823-4ff1-8c1e-57981a6e9449","year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2403.19026","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:d9235787ae0c14a4778a55bedb6883a8cccdb6eef2880ee5c1eb3cb92db8f590","observation_id":"383f2029-8a44-4880-9512-a11756f0e28d","resolution":{"observed_at":"2026-07-03T00:27:29.693295Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:aa1ecbf566fd002bacdb9f21879ad29b9a0facc934dbabeae34e22eddf560a30","observation_id":"07d7f1f7-3e63-4e8b-b169-94183c628fef","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:38db36daf6ea8f2831c95d7e0a13bab121421c82bf4e7234a6ff60208b6de20e","observation_id":"ea260b1b-b7f3-4009-b230-f2259288b332","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"An outlook into the future of egocentric vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:37a963b214c4cfa9bee882dc8ae9135b0b56bf83ce639b4f8c29a0c507d79048","observation_id":"4726cbaa-423f-4dfa-bd47-047b4cc63bcb","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Egolife: Towards egocentric life assistant,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:23717df244dd0bab6fd2cb4b0fcdf7137f7cb76e3b599f6fd29a477c62e5a2de","observation_id":"e86667fc-7de0-4676-9c80-3a6280931162","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17581","last_updated":"2026-06-30T02:43:22Z","snapshot_observed_at":"2026-08-07T22:01:12.899345Z","submitted_at":"2025-11-15T15:59:36Z","title":"EgoCogNav: Cognition-aware Human Egocentric Navigation","version":3},"cited_work":{"arxiv_id":"2511.17581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.17581","snapshot_observed_at":"2026-07-03T00:27:29.659288Z","title":"arXiv preprint arXiv:2511.17581 (2025)","venue":"cs.LG","work_id":"f79846bc-d49e-4e2e-bc34-2753f1869b1c","year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2511.17581","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:2a991ea0936f702dfdfbe26786232f429a9117a342de3a14ac75bf7516c9cdf9","observation_id":"045b6d09-7e66-4972-bcb1-c3fa6acd7e14","resolution":{"observed_at":"2026-07-03T00:27:29.660613Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Lookout: Real-world humanoid egocentric navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:3777637c4e6e5356f7ddd9a97029794c5c0699cb1db19bae46c04a557ff0d960","observation_id":"b6facd0e-cec0-4beb-b701-c4b755743cf4","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20324","last_updated":"2024-09-30T14:26:09Z","snapshot_observed_at":"2026-07-06T19:24:35.007698Z","submitted_at":"2024-09-30T14:26:09Z","title":"HEADS-UP: Head-Mounted Egocentric Dataset for Trajectory Prediction in Blind Assistance Systems","version":1},"cited_work":{"arxiv_id":"2409.20324","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.20324","snapshot_observed_at":"2026-07-03T00:27:29.674174Z","title":"Heads-up: Head- mounted egocentric dataset for trajectory prediction in blind assistance systems,","venue":null,"work_id":"3050f652-5e1c-4aa4-92fd-0c8a2b8f1d67","year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2409.20324","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:0274417cfa120550e994cb929cb0ad615230227673ef6b57e7271ed131ce9d6a","observation_id":"a8e202bb-8cc7-4911-81f0-d38c8fe1147c","resolution":{"observed_at":"2026-07-03T00:27:29.675869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Egocentric human trajectory forecasting with a wearable camera and multi-modal fusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:87915be753a25b8c73e19c0f22af2045310691cd79a2b7377c5fec7a7db5e380","observation_id":"cb1ebd8b-00a6-4617-8d11-29e556b205ee","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"KrishnaCam: Using a longitudinal, single-person, egocentric dataset for scene understanding tasks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:2878c1b33953fca69c5b047a85ada3d6f9f0458b3afc4c967f77c66743c3c572","observation_id":"85033b4b-6be4-41f6-99b7-c197bf8f19e4","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Egocentric future localization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:6e8f3ae3489268952b78c186c4f957c38e442cd10fe78e2393d181b91c0f5028","observation_id":"833541b9-b19d-4a4c-8302-bd06132b7b72","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Pedestrian intention prediction for autonomous vehicles: A comprehensive survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:00840fdca50d69db088e7d3447825599c49cc3ddc4bbf5325668525beb5d709f","observation_id":"1078c9ee-9460-4c66-845d-30830139088d","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"GPT-4V Takes the Wheel: Promises and Challenges for Pedestrian Behavior Prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:0e42cefe06f64f6c88fb421af43a452991f0264e25c8dfee0d6d8f670a470efa","observation_id":"0915f032-7cf4-4331-a100-210cd1ed0c95","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"OmniPredict: GPT-4o Enhanced Multi-modal Pedestrian Crossing Intention Prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:a77aaadde90effc66b9cb52c61e8c9c796e50fa0e2cf12a1a560a38a517fba38","observation_id":"d64df1dd-9b5c-48ef-81d1-53719e388f7b","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Seeing beyond frames: Zero-shot pedestrian intention prediction with raw temporal video and multimodal cues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:3f6f68f3f21ade0ef2fd72756542d383956cec4153bc1792558defcc0953d5f3","observation_id":"451f2793-aea3-46ec-a694-3985bab79be0","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:63dd4a359f3fa630217d93d95d243088c6e5a66798413d20d6891b2870cfb3a8","observation_id":"f3a739d3-43fe-47ca-83a2-37f147ebb3be","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Optimizing Vision-Language Model for Road Crossing Intention Estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:36255b24d41737bf90568b3d046ab0de83a2280c233a040743dd10194d7af6ad","observation_id":"ba4a1df2-e453-46fe-a49b-631b7d2dba3b","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Pedestrian Vision Language Model for Intentions Prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:cc6f3485d580e49c86bb55afba4a3850050740c07cfb68cda059ef14bd799f2e","observation_id":"a2c2e360-22a0-4e17-8e67-e9159ec078d0","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06680","last_updated":"2025-07-30T17:16:46Z","snapshot_observed_at":"2026-08-04T23:01:19.418024Z","submitted_at":"2025-01-12T01:31:07Z","title":"Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2501.06680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06680","snapshot_observed_at":"2026-07-03T00:27:29.688578Z","title":"Application of Vision-Language Model to Pedestrians Behavior and Scene Under- standing in Autonomous Driving,","venue":null,"work_id":"ac80d99b-3460-4746-a904-1c6f619872f7","year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2501.06680","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:f96745cb29dd12b65a44d05df96411f5c0d5fcf48b85bb4cbf68421d8f30db19","observation_id":"aee234ee-929e-4b32-8ae2-c61d2a8c9c63","resolution":{"observed_at":"2026-07-03T00:27:29.690221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Vlmped-cot: A large vision-language model with chain-of-thought mechanism for pedestrian crossing intention prediction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:11347f6e09b0f239b68fcf4258145c9c80a056babd338a7ddbc32405133a9e02","observation_id":"30a7d0f3-9a98-4bf9-84c2-d60d19d40505","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02748","last_updated":"2018-07-31T09:05:07Z","snapshot_observed_at":"2026-08-03T12:36:09.252863Z","submitted_at":"2018-04-08T20:07:13Z","title":"Scaling Egocentric Vision: The EPIC-KITCHENS Dataset","version":2},"cited_work":{"arxiv_id":"1804.02748","doi":"10.48550/arxiv.1804.02748","metadata_source":"pith","pith_arxiv_id":"1804.02748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Egocentric Vision: The EPIC-KITCHENS Dataset","venue":"cs.CV","work_id":"dbb8cde3-c0f4-4890-b1b5-f2fdb8718373","year":2018},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/1804.02748","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:707365282e7164357da1ef5901b5eed9bf8156e76630120d5caba4cc15bcdfea","observation_id":"3f78746e-079d-4487-a15a-6bf6ffe3da56","resolution":{"observed_at":"2026-07-03T00:27:29.665460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T15:23:26.057126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T15:23:26.057126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Actor and observer: Joint modeling of first and third-person videos,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:b45e37d088714917b719dd37406f0ac36d37c09564f619dcf9663eb80abdf2d9","observation_id":"d07f28ea-020a-470b-a181-e3513eaab16b","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:3a5ae0c2977c5f1da58edefce1e4e00ff9260fa12fe9f8b397648bf5bbe4d9f3","observation_id":"d6876619-31bf-4cd8-9876-0942c10bed97","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-03T16:08:46.390961Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":"2406.18070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-07-03T00:27:29.684649Z","title":"Egovideo: Exploring egocentric founda- tion model and downstream adaptation","venue":null,"work_id":"970562e5-6100-4e29-8c80-06fbf88f62f4","year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:c8561e793fb7857b07e06795cadf1952c8956f963760fed4fe385e1add066230","observation_id":"238674b4-3214-4c28-90ac-257b3e17703c","resolution":{"observed_at":"2026-07-03T00:27:29.686182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Video question answering: Datasets, algorithms and challenges,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:663b2ba15ddf112d73d1d4ca1a65cf1854bbee66913618fac1058650af080c9a","observation_id":"08552ab6-46d6-4623-be20-038fdb3328b9","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Video question answering via gradually refined attention over ap- pearance and motion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:4f46c5c24b41c884002fc3a9d89633653963993ec258a15cf57348c5157df129","observation_id":"84b83758-0e70-4074-8500-882c4cf276fa","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Tgif-qa: Toward spatio- temporal reasoning in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:1cfd85c92b3daaadeeaf1c96d4f5927cc60a1e87f8fb2ae188a1ad410c7a962f","observation_id":"526e1b70-464a-40e5-b994-342bd2f59207","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:8784fb936bfc9b6b859ea1b7307a0a513e4630597df6f1489ed562802fc7daa2","observation_id":"46884596-2fe6-4aca-bb42-45f976ef3b8e","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:b35496979f5d850fcc9594530fb3354155360a11e6e409d7c883fdc2ae7bd0bc","observation_id":"d53d2105-5713-4960-a549-09c8bdf2b330","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Agqa: A benchmark for compositional spatio-temporal reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:d84e9bf7d3ae889de1f38a39c217d6dff2b2805242ccc2d65ad9eb8e1d517206","observation_id":"11f21bec-81d8-46b3-a156-6b2ddc5f1c30","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"From representation to reasoning: To- wards both evidence and commonsense reasoning for video question- answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:b9623009301e7bb307ba5a6bc41ec9dce8dcb25d5a03b0447d41d29a5ac0b01f","observation_id":"0583cc37-0857-4cdb-9046-52b96999dc56","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Egotaskqa: Understanding human tasks in egocentric videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:c91d7edf2600e27613aa849dcee0643fa120b1a0df5db1ebac5df53901d9cc77","observation_id":"8b5648aa-5505-41a4-b356-09ca8883ed37","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Intentqa: Context-aware video intent reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:089de7ce076097460781a761dec4498b0c5a8c901b658dd56ebd9bd4823f3f8f","observation_id":"394094fd-5615-476e-bf62-a9a7fce3d8fe","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.07447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:46:52.305785Z","title":"In the eye of mllm: Benchmarking egocentric video intent understanding with gaze-guided prompting","venue":null,"work_id":"04326be3-9128-4727-845c-6fb15a1bc3c4","year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:4bb31608b9dc6947236bd1dcccffd204177b12466e2597fd64b703732448e097","observation_id":"4dab975f-bb5c-49d6-8f2a-dbbb3f5f33b4","resolution":{"observed_at":"2026-07-03T00:27:29.670686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:21aa8d69a6184444405c771b204e426e65cd1034e49da6cae5bdb9aed2261342","observation_id":"531b9dbd-e5fa-4fc7-9901-f87aa630568e","resolution":{"observed_at":"2026-07-03T00:27:29.667996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:f4e9ae4c20a75610d9cb7d0bbb9c3a52a26bcdbdd492a8561dda6968e8302464","observation_id":"73064eea-3446-4818-a45d-46df9badeba7","resolution":{"observed_at":"2026-07-03T00:27:29.680667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Grounded question-answering in long egocentric videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:5987f56e455b5388f424855892320cd1285b62a2c7232fcdafb7aeab3e8653db","observation_id":"791ddcdc-faf3-4be6-b06e-8094bc62c4c1","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:e1d447af38ad9c3f37a6cb0d264863afd87abca2b44a7a6b9a583c3dda25f029","observation_id":"6007c9d7-e2e1-48fc-8187-659d98fae112","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":"2310.11441","doi":"10.48550/arxiv.2310.11441","metadata_source":"pith","pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","venue":"cs.CV","work_id":"ddc8878e-ed0c-4a66-952a-254dce1c622a","year":2023},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:c3487cb56e49c1fd47906cf565c5902bfb70ebfb38da70d02bafd432dab6e744","observation_id":"5875e811-4bf9-452d-91b9-2b0981eff465","resolution":{"observed_at":"2026-07-03T00:27:29.678342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Fine-grained visual prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:5a29eb50ea1bd4b1cdaaa18a78900c5cc36482d1f4af287b35d046783dd3fd7e","observation_id":"f58249e3-3ca7-4fa8-84bf-4296dfe282d1","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:ba351755d2bb55d2b3f18511dbc70eb3725acb8bb02f790ac21ac41b6410d0df","observation_id":"384b6566-a00f-402e-abaf-f675896a50aa","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:0960cc1c5cc5d4896966c90136bf7999e4d93d093987a06fbec2f196037ebceb","observation_id":"cb17fc77-4a29-4ce5-b5d5-a2ca876ba246","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Simple online and realtime tracking,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:83a0c31f195fe8166648d6ea154d9a49d91a6fa595be3b92d70222e66a3dc4e2","observation_id":"665f8116-a965-402a-8e22-270f8ac8d387","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Analyzing the behaviors of pedestrians and cyclists in interactions with autonomous systems using controlled experiments: A literature review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:df48062e39aa458b99e0d2fef0e9ebba8b849318fdbe42f876bf9e3b63464fe0","observation_id":"39d58828-2788-459b-b4a4-2623688d79b3","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Challenges and trends in egocentric vision: A survey,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:a69feb4df7de0734eedea0a282c0447797c8372654e1e52cf0b5bdf0065e8f73","observation_id":"0fb200aa-dc60-4f49-a0d5-c456b8f9001d","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19812","last_updated":"2026-05-22T04:49:36Z","snapshot_observed_at":"2026-07-06T22:49:52.077931Z","submitted_at":"2026-03-20T09:57:23Z","title":"Eye Gaze-Informed and Context-Aware Pedestrian Trajectory Prediction in Shared Spaces with Automated Shuttles: A Virtual Reality Study","version":2},"cited_work":{"arxiv_id":"2603.19812","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.19812","snapshot_observed_at":"2026-07-03T00:27:29.661787Z","title":"Eye Gaze-Informed and Context-Aware Pedestrian Trajectory Prediction in Shared Spaces with Automated Shuttles: A Virtual Reality Study","venue":"cs.LG","work_id":"72be31d1-bc1d-4b3e-80bd-c9273f47c1c8","year":2026},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2603.19812","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:4473c1f598ef341be74cfbb74e28b13cc74bf3f19fff60db6a19e0818d70d3ce","observation_id":"bbb3c8c5-db49-4ea4-98f1-cfa1e63911b3","resolution":{"observed_at":"2026-07-03T00:27:29.662992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:6657c7b4619ff0881402b581116e4d5ac378124036a253df54abf1229d04d282","observation_id":"6a9dcb69-82a4-4c93-a649-fda35ff0141c","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Learning Transferable Visual Models From Natural Language Su- pervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:9c7c1c1250ce4a906873ed0bcc24d36d7d760fa7f6653cbb4008190faf53e2b3","observation_id":"fd29ecfd-42f1-46db-84c6-7f9c799a6921","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04550","last_updated":"2025-04-06T16:58:23Z","snapshot_observed_at":"2026-08-07T16:08:11.303913Z","submitted_at":"2025-04-06T16:58:23Z","title":"Advancing Egocentric Video Question Answering with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.04550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04550","snapshot_observed_at":"2026-07-03T23:19:02.831705Z","title":"arXiv preprint arXiv:2504.04550 (2025)","venue":null,"work_id":"c3c153f6-6ef4-4511-8763-f12dade0b7d1","year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2504.04550","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:05fe7449dfc672fa325b8c5ba96d9cc2fe6f7ac7f1396de8216699e3bfdbf25e","observation_id":"a80980e7-0192-4524-a0ef-2b0480689392","resolution":{"observed_at":"2026-07-03T00:27:29.683514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-05T07:24:30.530987Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"cited_work":{"arxiv_id":"2605.22012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.22012","snapshot_observed_at":"2026-07-03T00:27:29.671833Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","venue":"cs.CL","work_id":"ab6f4fee-3152-44b2-b76c-b923b4a55aca","year":2026},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"cited_paper":"/paper/2605.22012","citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:c3e7d3b2b21911a01c899e8216a43128f001904a93a09f2f4fe78a034e669561","observation_id":"28a30740-3f42-43dd-bc95-8acb2038985a","resolution":{"observed_at":"2026-07-03T00:27:29.673053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T17:13:04.236686Z","title":"Chrono: A simple blueprint for representing time in mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T17:13:04.236686Z"},"links":{"citing_paper":"/paper/2606.09142"},"observation_digest":"sha256:bcc75205bbabf26371e58125a10e16dd55915aacaaf1519a2dd296164885f13d","observation_id":"9494379a-d940-41a3-9c29-07a85af5f911","resolution":{"observed_at":"2026-06-27T17:13:04.236686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09142","last_updated":"2026-06-08T07:39:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:53:45.204893Z","submitted_at":"2026-06-08T07:39:42Z","title":"Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":40,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2606.09142."}