{"as_of":"2026-08-08T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c547e17e1af5450fe8278cc816072c63244d9eea49ba11b6fecd67ecf8c64e68","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:59:56.791343Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:25:04.053283Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T13:34:40.932917Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":"2507.04141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04141","snapshot_observed_at":"2026-06-30T13:34:40.932917Z","title":"Pedestrian intention pre- diction via vision-language foundation models,","venue":null,"work_id":"be7f5d26-1f5b-40e6-b15b-394bac2e4b26","year":2025},"citing_paper":{"arxiv_id":"2605.24562","last_updated":"2026-05-23T12:56:44Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:56:44Z","title":"PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T13:25:04.053283Z"},"links":{"cited_paper":"/paper/2507.04141","citing_paper":"/paper/2605.24562"},"observation_digest":"sha256:0af4529faa52bbf7cca0f33d40af011ce66b5782b390f9675a92086fee45e6fa","observation_id":"0b661ac7-40da-44c8-b177-06d0579874c9","resolution":{"observed_at":"2026-06-30T13:34:40.934373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04141/citation-record","integrity":"/paper/2507.04141/integrity","json":"/paper/2507.04141/citation-record.json","paper":"/paper/2507.04141"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:53.815180Z","title":"Autonomous vehicles that interact with pedestrians: A survey of theory and practice,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:53.815180Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6e0b71636d8ffe8b989e9cd9000dd321f54c77ea5c549e1fd7a37df06de19aea","observation_id":"89755a4e-910f-4fd8-b046-ae3d7a248e5b","resolution":{"observed_at":"2026-08-06T19:59:53.815180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:01.265144Z","title":"Pedestrian intention prediction: A convolutional bottom-up multi-task approach,","venue":null,"work_id":"89b4fb24-1752-4a77-a399-5da6c1a7597e","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:53.876159Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:8d13ed93b1280c03aa47f3978af3777cd887c0e9f3c66d332f11111b82cb7b5b","observation_id":"6cc181ab-3fb6-4ce6-86b4-dfc0be51a1ff","resolution":{"observed_at":"2026-08-06T20:00:01.306110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:01.111349Z","title":"St crossingpose: A spatial- temporal graph convolutional network for skeleton-based pedestrian crossing intention prediction,","venue":null,"work_id":"30e5a72e-d07d-4213-9438-8065a7a835d8","year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:53.941914Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:5e2aa41b867e95dc22d6bf4455bfc8b5e53c670a6924e48f231f0dc90a43256a","observation_id":"64c0a2e8-e139-4b94-9995-dd787f946b28","resolution":{"observed_at":"2026-08-06T20:00:01.180728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12810","last_updated":"2025-07-06T19:28:52Z","snapshot_observed_at":"2026-08-08T07:04:05.404266Z","submitted_at":"2024-02-20T08:28:45Z","title":"PIP-Net: Pedestrian Intention Prediction in the Wild","version":3},"cited_work":{"arxiv_id":"2402.12810","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12810","snapshot_observed_at":"2026-08-06T19:59:57.136265Z","title":"PIP-Net: Pedestrian Intention Prediction in the Wild","venue":"cs.CV","work_id":"a7412f0b-d4ce-4a03-a2fa-83789640a32f","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.015290Z"},"links":{"cited_paper":"/paper/2402.12810","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:44b5e7e412809ca73f8cad6971a011128600537887cb8138a1194c4d63f1e857","observation_id":"8a87e33a-a222-4467-b198-55377e59f960","resolution":{"observed_at":"2026-08-06T19:59:57.232162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:01.028501Z","title":"Pedestrian action an- ticipation using contextual feature fusion in stacked rnns,","venue":null,"work_id":"ff96f07c-b9d6-4f97-98fe-e00e2db88609","year":2020},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.088410Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:9d254403ab766a717cc966ac7046b1fbe2589f8474389360e2261d4df7931e97","observation_id":"0757d55c-1420-4cf7-b0c6-b743acbad52b","resolution":{"observed_at":"2026-08-06T20:00:01.062175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.876828Z","title":"Do they want to cross? understanding pedestrian intention for behavior prediction,","venue":null,"work_id":"a224bc3e-9ade-4e4b-85b8-1d02124f6368","year":2020},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.171753Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6e7d018c6997c6ac66f4120ae0ee33545d6e3bffda15f87bd143db5e8f18dc55","observation_id":"1fb433de-cfe6-4c8a-aea3-b8e46effe73e","resolution":{"observed_at":"2026-08-06T20:00:00.945196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.695181Z","title":"Multi-modal hybrid architecture for pedestrian action prediction,","venue":null,"work_id":"1cb94507-7993-44dd-b8e4-e7ec48b74480","year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.251824Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:17b25900e2e3664ffa51e69a48509ce769f3860e654bdf578ced6d8d4967d91d","observation_id":"096beed4-6d41-4232-b594-91f5044818fc","resolution":{"observed_at":"2026-08-06T20:00:00.783093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.506816Z","title":"Pedestrian graph+: A fast pedestrian crossing prediction model based on graph convo- lutional networks,","venue":null,"work_id":"11ebf8d2-589a-48ee-8fe6-1ad91ddc809c","year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.354966Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6a312ffb10687753e658948008eed76c5e928f1f9949332757c6dc19e7be82b6","observation_id":"57272dc5-5f20-416e-9830-2ae0172d7b8e","resolution":{"observed_at":"2026-08-06T20:00:00.594842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.395261Z","title":"Visual reasoning using graph con- volutional networks for predicting pedestrian crossing intention,","venue":null,"work_id":"ee8188aa-34c3-47f0-99d0-457cb9545511","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.433966Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:0705d42c188004809b3164008ebe92f360a94f0d268d3fbaa6232f14e3e7080c","observation_id":"6d431e29-b0a2-484d-924a-97647a9e5bcc","resolution":{"observed_at":"2026-08-06T20:00:00.447152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.227431Z","title":"CAPformer: Pedestrian crossing action prediction using transformer,","venue":null,"work_id":"c697439d-7c3c-4ca6-83f2-ae66ecb38bee","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.497886Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:f2a03a822a0d4ac6c1d86c529c8b930291fec4352abefb0e4ce1bc8a2f703874","observation_id":"e4e1f283-16ef-4438-84c3-4698cef4f6e0","resolution":{"observed_at":"2026-08-06T20:00:00.297573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.031758Z","title":"Pit: Progressive interaction transformer for pedestrian crossing intention prediction,","venue":null,"work_id":"76b826fc-5ecd-44d1-9eb1-27983a77d24d","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.565677Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:bb4a3d682b4f3445090d70d0d3c35974a748002ce96091acfe9c333d2612b41d","observation_id":"7521fcd7-f346-42b0-82ff-37c9cd83ea1b","resolution":{"observed_at":"2026-08-06T20:00:00.122113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.866575Z","title":"Predicting pedestrian inten- tions with multimodal intentformer: A co-learning approach,","venue":null,"work_id":"c951a898-3b5b-4ad6-b55e-e5a5f4e47204","year":2025},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.646030Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:c40ce4a059460c72a927eb45263493c2bc6a6bdef802a745c6b42e4c2f9b3464","observation_id":"841f712e-7dfd-4388-9ebb-c567f59da6c3","resolution":{"observed_at":"2026-08-06T19:59:59.936485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.709143Z","title":"Pedestrian behavior inter- pretation from pose estimation,","venue":null,"work_id":"588070c6-bcae-467a-a818-e7f0025cd6e5","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.713024Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:0f0378a6f3f217e096ef4e59e6a498432c5fa865b785ca9be399ee370cdc3e30","observation_id":"cbc0cc2c-ff16-477a-aa65-247a29a4ad34","resolution":{"observed_at":"2026-08-06T19:59:59.789304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.518073Z","title":"Multi-scale pedestrian intent prediction using 3d joint information as spatio-temporal representation,","venue":null,"work_id":"53754ea5-0c44-4fd5-b59a-012c87f891bc","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.773984Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:a8a9c61d720b88fb47f77ab0553036133096b9a2bb8b474f10c46000de6ae110","observation_id":"e7e25164-28e8-4cf8-9723-5db6a1c92a99","resolution":{"observed_at":"2026-08-06T19:59:59.600266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:54.861620Z","title":"Spatiotemporal relationship reasoning for pedestrian intent prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.861620Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:103840e33aaf5ea74cbedda36d97adaf08105e2893e67a349c0be59b5600d99c","observation_id":"d72d0405-b7da-412a-ab62-1046703f990a","resolution":{"observed_at":"2026-08-06T19:59:54.861620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.329499Z","title":"Real-time intent prediction of pedestrians for autonomous ground vehicles via spatio-temporal densenet,","venue":null,"work_id":"951990a9-a7cf-488a-a5b1-4e65199524c8","year":2019},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.933786Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:2371604a55abbf39b2ef91c1d6674c10ae82a2497b8d52c56debdff1fed8bacc","observation_id":"42de927b-2ff4-4089-ad57-1ffa7ba398ac","resolution":{"observed_at":"2026-08-06T19:59:59.442338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.147571Z","title":"Pedestrian-vehicle information modulation for pedestrian crossing intention prediction,","venue":null,"work_id":"86f71d22-fcaf-4200-9058-ab26f80e3ea7","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.998685Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:1843b3ce128a8bf13e5aff47280a4ffd926117bfab35f9413691a7d6cf4315f6","observation_id":"aa461dfd-b696-4dcc-9b73-896c835a4f53","resolution":{"observed_at":"2026-08-06T19:59:59.265412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.999779Z","title":"Causal reasoning in typical computer vision tasks,","venue":null,"work_id":"e42ddec4-024a-4ceb-9542-14a8a46c9f86","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.083231Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:52830cc535c809deb74ec78c1f537d49cd9bd5a33f75e10a99f3a43cdd8e7037","observation_id":"615b7547-8719-485d-bfb7-e2ac534abdcf","resolution":{"observed_at":"2026-08-06T19:59:59.071147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.853436Z","title":"Vision language models in autonomous driving: A survey and outlook,","venue":null,"work_id":"e4bbb266-60f9-4b1c-add4-d834e9c11e7f","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.171703Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:d1c612edd195a4eebba5c9ed1d7f77dd92c4e046fcbd7c0ed35b8bf0bab9f7a0","observation_id":"18069a05-b99a-4246-9453-288c0dc92147","resolution":{"observed_at":"2026-08-06T19:59:58.920039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.676090Z","title":"Gpt-4v takes the wheel: Promises and challenges for pedestrian behavior prediction,","venue":null,"work_id":"f02683b0-91c2-4d49-8765-bf4726c9cb1a","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.267162Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6a3c7d3e7b065f0ea07572799295a73ff1b54eabf3476eb727da2502976ff4df","observation_id":"35d3e16b-b52f-4d17-b32c-0190c0006e9a","resolution":{"observed_at":"2026-08-06T19:59:58.761794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.498788Z","title":"Omnipredict: Gpt-4o enhanced multi-modal pedestrian crossing intention prediction","venue":null,"work_id":"ca895340-c965-4c40-b6de-4bc737302aae","year":null},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.367452Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:1b810d7dca22f8ff86e32fb043ba652ccc8494c456c81f489e5432c881d651fe","observation_id":"ef2988a4-73fc-4e49-8be5-1a12e03fc931","resolution":{"observed_at":"2026-08-06T19:59:58.575555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.299614Z","title":"Pedvlm: Pedestrian vision language model for intentions prediction,","venue":null,"work_id":"f960c803-0ff1-40c6-a4df-a69fb74397f9","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.459977Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:73a112d8c46edba18e0f909599eaa6b36016d939751da43b97a61c4f32944840","observation_id":"a05142d2-747f-4bde-8387-19af28ae0283","resolution":{"observed_at":"2026-08-06T19:59:58.398927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.125645Z","title":"Cross or wait? predicting pedestrian interaction outcomes at unsignalized crossings,","venue":null,"work_id":"9492d69f-3391-4795-91c9-44b08482e3e4","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.569120Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:fb84c2ea0b946f195a789fccedbd3376af86c74c385af8491c2148f4e1b88ac5","observation_id":"bf34fca6-b13d-4b6f-8afd-f1890ef41e1f","resolution":{"observed_at":"2026-08-06T19:59:58.222821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07645","last_updated":"2024-09-11T22:13:01Z","snapshot_observed_at":"2026-08-02T23:13:15.299065Z","submitted_at":"2024-09-11T22:13:01Z","title":"Feature Importance in Pedestrian Intention Prediction: A Context-Aware Review","version":1},"cited_work":{"arxiv_id":"2409.07645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.07645","snapshot_observed_at":"2026-08-06T19:59:56.995785Z","title":"Feature Importance in Pedestrian Intention Prediction: A Context-Aware Review","venue":"cs.CV","work_id":"329228d6-d219-42c5-8187-a61b559cdc58","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.663331Z"},"links":{"cited_paper":"/paper/2409.07645","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:3e792a77629784ba499a2ef65df3e45db386f6e2a5d53aad732110bd478a3e00","observation_id":"5fdb116b-8981-422a-8255-343c2ee44d16","resolution":{"observed_at":"2026-08-06T19:59:57.055566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12644","last_updated":"2025-07-21T01:47:18Z","snapshot_observed_at":"2026-08-06T15:55:13.001632Z","submitted_at":"2024-06-18T14:12:27Z","title":"Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12644","snapshot_observed_at":"2026-08-06T19:59:55.734120Z","title":"Hierarchical prompting taxonomy: A universal evaluation framework for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.734120Z"},"links":{"cited_paper":"/paper/2406.12644","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:d49516c8e3aeaa29b15b7a9414f683372b024823a9416e6cca17513451079bb0","observation_id":"ca7ff6da-26b8-4be8-b4bd-6873e3b2a77b","resolution":{"observed_at":"2026-08-06T19:59:55.734120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01910","snapshot_observed_at":"2026-08-06T19:59:55.815565Z","title":"Large language models are human-level prompt engineers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.815565Z"},"links":{"cited_paper":"/paper/2211.01910","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:0606e89866e311b325120192635a557cd2431e6d03aaace43aeb5e4d770a708f","observation_id":"fc62114f-4913-4812-9b21-2bc71f52489a","resolution":{"observed_at":"2026-08-06T19:59:55.815565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.958074Z","title":"Benchmark for evaluating pedestrian action prediction,","venue":null,"work_id":"936936b9-a4ee-4128-9f63-8c36734a0844","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.901830Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:579f2d7551e715b0246dcc44cbd040ab05ecbce28997936616faee4c013a7669","observation_id":"9ceed48e-7f92-4f3b-9b9f-8c3bd66adac8","resolution":{"observed_at":"2026-08-06T19:59:58.017275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07702","last_updated":"2024-03-14T02:07:11Z","snapshot_observed_at":"2026-08-02T18:42:43.546865Z","submitted_at":"2023-08-15T11:08:30Z","title":"Better Zero-Shot Reasoning with Role-Play Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07702","snapshot_observed_at":"2026-08-06T19:59:55.992136Z","title":"Better zero-shot reasoning with role-play prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.992136Z"},"links":{"cited_paper":"/paper/2308.07702","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:221c456170c9d0ca3201dee7f27357401cd9dd2020e8c98fa1895ed801d1a91b","observation_id":"99d7b5b0-b85f-469a-8584-a08fa55707f7","resolution":{"observed_at":"2026-08-06T19:59:55.992136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17600","last_updated":"2024-01-31T04:57:12Z","snapshot_observed_at":"2026-07-06T17:22:53.623679Z","submitted_at":"2024-01-31T04:57:12Z","title":"Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17600","snapshot_observed_at":"2026-08-06T19:59:56.092349Z","title":"Good at captioning, bad at counting: Benchmarking gpt-4v on earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.092349Z"},"links":{"cited_paper":"/paper/2401.17600","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6e68e375213a8cc46a7329c486ceb0a8a8d8f5739a9fe025c5445a9c6d537d17","observation_id":"699aaa9e-581e-4a0c-afd9-1752e25544cb","resolution":{"observed_at":"2026-08-06T19:59:56.092349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.808945Z","title":"Is the pedestrian going to cross? answering by 2d pose estimation,","venue":null,"work_id":"1429fe87-55b8-432f-8899-b7d96b7efd5d","year":2018},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.186360Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:1d9e9003b348242faa11ef2412011384045b476de948ab4ce3e38f74f84f788f","observation_id":"1cd8d6af-bea9-49c0-8646-1cf809825b86","resolution":{"observed_at":"2026-08-06T19:59:57.884083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.649334Z","title":"Chatgpt: Generative pre-trained transformer,","venue":null,"work_id":"09dd32e4-80e0-4e1c-b668-c011e59e9a38","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.286479Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:fffffac96cb90be13af38cab98ade4bb0c6e8682aafdd16ec4910b06bac9ccd9","observation_id":"4e747a18-0a1f-454e-8ab8-2bf16ea658da","resolution":{"observed_at":"2026-08-06T19:59:57.715335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.526641Z","title":"Agreeing to cross: How drivers and pedestrians communicate,","venue":null,"work_id":"53707847-60f7-4cea-af48-287a4ecbcdc4","year":2017},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.376470Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:1a10f415bb8c5f0fb8b412e8a2fcd24fcfaa3f53651326ee6af6a375688418eb","observation_id":"35420cca-34d7-4473-94d1-ff1a8173274b","resolution":{"observed_at":"2026-08-06T19:59:57.594088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.335630Z","title":"PIE: A large-scale dataset and models for pedestrian intention estimation and trajectory prediction,","venue":null,"work_id":"ba26ab65-147b-4c0c-9f60-6c663c28d8fd","year":2019},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.479906Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:5965c65541fb5427f8c419856a6242801bfa285399bf6c541930ae27803af128","observation_id":"c5cf1eb8-ead7-4137-abbd-bfce2e73541e","resolution":{"observed_at":"2026-08-06T19:59:57.417787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:59:56.585090Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.585090Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:cd4edce3f25e86dc9148c965beecfdb60793c8bbc5430eaf3e79ce20fbdecb8c","observation_id":"398caa99-291c-4851-bb0a-8b63ce9b5728","resolution":{"observed_at":"2026-08-06T19:59:56.585090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:59:56.685176Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.685176Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:4adb29cf833aa1ae64a2ed6b2e4b23eac7996dc1672768a0ec05541a31ce2088","observation_id":"768bfb91-1616-4cd3-82f5-8b553a37cf52","resolution":{"observed_at":"2026-08-06T19:59:56.685176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T19:59:56.791343Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.791343Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:c66aa52ebca7b2986def5c30e4d4262160b7cf2f9426e580b57e2bf2a2f64862","observation_id":"f989038e-d8a4-4f79-a1a3-12bf90ba02b3","resolution":{"observed_at":"2026-08-06T19:59:56.791343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:03:31.815734Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2507.04141."}