{"as_of":"2026-08-08T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8f9b29e6095dab36c01927f5fdc1a71a9a509eeb9915444c666b7d04e77a621","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:23:14.558335Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02615/citation-record","integrity":"/paper/2506.02615/integrity","json":"/paper/2506.02615/citation-record.json","paper":"/paper/2506.02615"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:18.156415Z","title":"Spherical transformer for lidar-based 3d recognition,","venue":null,"work_id":"fc86cd4d-6b24-418a-8a78-ecd6eb3d38b6","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.510042Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:6c576371589cf1e0b83989339c2afb1bb55eaa75e6c29ad642080adf97b29f74","observation_id":"b0cbb2dd-c1e8-4c7c-8218-59c0e5f81b4c","resolution":{"observed_at":"2026-08-07T11:23:18.242083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.904726Z","title":"Rea- son2drive: Towards interpretable and chain-based reasoning for au- tonomous driving,","venue":null,"work_id":"f0f1d38d-6d5a-4c1b-976a-bf54bf5cf807","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.552518Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:0c6ddc78a546cf97f96d89ee04f9e6494491db15844fdb560b93033e306049ab","observation_id":"db2325a5-b133-499e-b29b-043b829e37ba","resolution":{"observed_at":"2026-08-07T11:23:17.994358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02205","last_updated":"2024-02-07T13:09:15Z","snapshot_observed_at":"2026-08-07T07:39:39.887541Z","submitted_at":"2024-02-03T16:38:25Z","title":"GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02205","snapshot_observed_at":"2026-08-07T11:23:12.643347Z","title":"Gpt-4v as traffic assistant: an in-depth look at vision language model on complex traffic events,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.643347Z"},"links":{"cited_paper":"/paper/2402.02205","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:07a28df3aa1b5d9b2ba28d70f84cbc78518807e62a4a61e1e2614d5ecba79f50","observation_id":"ebd7634f-7846-439d-a3ec-c488704bf2aa","resolution":{"observed_at":"2026-08-07T11:23:12.643347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.609614Z","title":"DriveVLM: The convergence of autonomous driving and large vision-language models,","venue":null,"work_id":"68560d45-9504-47f2-a7af-7f686d978e08","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.700488Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:da04e9c064b7ab9564003aaee85d701cec297974cebde4a14f6f1c50482edc4c","observation_id":"b21e0480-4d1f-4f23-b446-a5dcb535547a","resolution":{"observed_at":"2026-08-07T11:23:17.756695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.344239Z","title":"BLIP: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"23a9b292-3ed5-4832-8a30-2bed32ebc374","year":2022},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.731307Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:d0198de431d1c4214794b6337d6c23212825bf3f874a170a821e6317f9991362","observation_id":"a2ca9fb8-e7f4-4487-acec-05afb4933ac4","resolution":{"observed_at":"2026-08-07T11:23:17.438610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:17.034157Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":"e15d1130-92dd-418a-b29f-bf8088f0c6cd","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.811578Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:9ad8aeb8a0909f24d01348a61f1933de77841b8a5c12e05e76849e1c18c46ca6","observation_id":"6963edf6-5390-4462-8e3d-3c80c5aa53aa","resolution":{"observed_at":"2026-08-07T11:23:17.195480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.731855Z","title":"Jiang, A. Tagliasacchi, M. Pollefeys, and T. Funkhouser, “Openscene: 3d scene understanding with open vocab- ularies,","venue":null,"work_id":"7ab80470-9831-4ace-a18d-759186da7945","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:12.896521Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:4dac1109b987eb2ad429fdc7bab581d2b7794a0bda72a73e4e65756febaaeaf5","observation_id":"597f786b-fe0c-447d-9e0e-11ca408ee3c9","resolution":{"observed_at":"2026-08-07T11:23:16.935102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.495791Z","title":"Pla: Language-driven open-vocabulary 3d scene understanding,","venue":null,"work_id":"d016a7ed-5d71-4dac-943e-f09655146cc3","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.020546Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:5d6aeb13cff0afd1a36c4dc5ca44b602a43c8e2ac87a301e0187f1527f6bfc0a","observation_id":"e316f44c-cf65-42b6-8a72-d5771e19f43d","resolution":{"observed_at":"2026-08-07T11:23:16.597432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:13.119412Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.119412Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:9c690b415310d946383f12002e73cd4504696688e50a9918d34342d03922c5b4","observation_id":"8e082adb-b2e0-4caf-8991-74438cb51821","resolution":{"observed_at":"2026-08-07T11:23:13.119412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.181866Z","title":"The traffic scene un- derstanding and prediction based on image captioning,","venue":null,"work_id":"ad8f7c80-1765-424b-92de-5b5fecabbb04","year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.240502Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:9611ae69b82ec70be1a1653a9d7934580eee2d3f5f3c6b9a16a0fba990b181e7","observation_id":"0c7d06ac-d4f1-4a68-9d5a-24fd23cf89eb","resolution":{"observed_at":"2026-08-07T11:23:16.384009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:16.066776Z","title":"Delving into clip latent space for video anomaly recognition,","venue":null,"work_id":"2e776acb-c1d3-465f-bac5-d6be1d8cc5d9","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.339597Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:0b7139ac369742f0d0468fd168390355b1def6e0f96525a8b37f67a9ff600f53","observation_id":"101ebe9c-9183-4f49-82aa-f422d7fb56a6","resolution":{"observed_at":"2026-08-07T11:23:16.108961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:13.482123Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.482123Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:982e3ebab6992af518acfb547ed7910f52041002fa061a223a13fc1f86c4a31a","observation_id":"212ca42e-a757-42f2-ac76-e26492b69d59","resolution":{"observed_at":"2026-08-07T11:23:13.482123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-07T11:23:13.595461Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.595461Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:4c6fd177ebeb435e36cf925bb9b6eaa1a553170df3aab669790f73502ae86c0d","observation_id":"08761c9a-b025-4ba5-8f76-416a3fc6726a","resolution":{"observed_at":"2026-08-07T11:23:13.595461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.967322Z","title":"Vectornet: Encoding hd maps and agent dynamics from vectorized representation,","venue":null,"work_id":"de7280fe-374b-43b5-9ab8-f47aea82d6a3","year":2020},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.727279Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:9a8ad1a2dc440e2905d09878b81171b3d1040dae9439ee37dbfbb777ee286ef7","observation_id":"43ab1c19-b7c8-48aa-aa60-4a48018b4346","resolution":{"observed_at":"2026-08-07T11:23:16.011931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05805","last_updated":"2021-08-12T15:37:30Z","snapshot_observed_at":"2026-07-06T11:37:49.019764Z","submitted_at":"2021-08-12T15:37:30Z","title":"Reimagining an autonomous vehicle","version":1},"cited_work":{"arxiv_id":"2108.05805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.05805","snapshot_observed_at":"2026-08-07T11:23:14.890860Z","title":"Reimagining an autonomous vehicle","venue":"cs.LG","work_id":"fde98dfc-b0ad-4616-8675-1dd08e51804f","year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.817011Z"},"links":{"cited_paper":"/paper/2108.05805","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:bd7e2545243a415934b9ca1a15417233d19801ca02d9181862b97b2b2fabcdaa","observation_id":"bfe27062-e1d8-437a-a555-578abb92c5fb","resolution":{"observed_at":"2026-08-07T11:23:14.984276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.824348Z","title":"Explainable artificial intelligence (xai): Concepts, taxonomies, opportunities and challenges toward responsible ai,","venue":null,"work_id":"42d53576-ed97-49bf-a6d6-eb9b6b00e252","year":2020},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.891608Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:6eaeb882bce6f0f4c1a82fb2336620ab5fe30af2e75970912cca11e5fb529042","observation_id":"a0a3c807-ec43-42a4-8d44-2a30e46a5e91","resolution":{"observed_at":"2026-08-07T11:23:15.867593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.706090Z","title":"From automation to autonomy and autonomous vehicles: Challenges and opportunities for human-computer interaction,","venue":null,"work_id":"0e3d5261-04a9-4291-a5ad-50756acc8910","year":2021},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:13.955573Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:ca5623ef957cca6dda54bbe972dd51e2976666414c3f6e6ef979345d1897a1db","observation_id":"26ff000f-8917-4c67-bca6-31f7d4ad6930","resolution":{"observed_at":"2026-08-07T11:23:15.758020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03026","last_updated":"2025-04-15T03:45:30Z","snapshot_observed_at":"2026-07-06T16:27:51.438846Z","submitted_at":"2023-10-04T17:59:49Z","title":"LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03026","snapshot_observed_at":"2026-08-07T11:23:14.026613Z","title":"Languagempc: Large language models as decision makers for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.026613Z"},"links":{"cited_paper":"/paper/2310.03026","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:38aa4c0b69c5355368ffdad6a42f79c379a8213327d6922bcf449c46fd903be6","observation_id":"fd326759-a542-4496-b394-370e4317e8fb","resolution":{"observed_at":"2026-08-07T11:23:14.026613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.554512Z","title":"Lm-nav: Robotic navigation with large pre-trained models of language, vision, and action,","venue":null,"work_id":"031c7b19-758b-4630-9b92-1cde64adfcda","year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.068576Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:b9944c9e942d96596450206290ea8651462867f12693fd4b9e9b813a65071b28","observation_id":"009525c1-7108-4b0f-841b-2898fddf9f13","resolution":{"observed_at":"2026-08-07T11:23:15.644833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16292","last_updated":"2024-02-22T03:24:26Z","snapshot_observed_at":"2026-07-06T16:24:49.716011Z","submitted_at":"2023-09-28T09:41:35Z","title":"DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16292","snapshot_observed_at":"2026-08-07T11:23:14.113366Z","title":"Dilu: A knowledge-driven approach to autonomous driving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.113366Z"},"links":{"cited_paper":"/paper/2309.16292","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:b1678e8b7f828c5cb85252ce6d22c0933c1711baebacea0abd5c22e4a75d97ea","observation_id":"439f4f6a-e764-44cf-bd1c-228f1e3b279a","resolution":{"observed_at":"2026-08-07T11:23:14.113366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.366795Z","title":"Driving with llms: Fusing object- level vector modality for explainable autonomous driving,","venue":null,"work_id":"a4eb91e6-1070-4fd9-9adb-1b1abd3da730","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.182507Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:14f96817479332f946a71157510745efad223c4c2f46ddf164a2f5c599fef296","observation_id":"c9dcfaf7-e65c-424a-92cf-24e977e57cb6","resolution":{"observed_at":"2026-08-07T11:23:15.445095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-07T11:23:14.218939Z","title":"Gpt- driver: Learning to drive with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.218939Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:acd3216d39468b4d5b70469f380448fcaeea000c9b9c73b980f68aa1ee945995","observation_id":"a06e06f1-6544-4233-b29f-5e7294f6bfdf","resolution":{"observed_at":"2026-08-07T11:23:14.218939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.317834Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.317834Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:c8541eb2f64bf500d6b71595df8fd47f693a04beccc6e172714e1daf6654d74e","observation_id":"9bc840b0-96eb-4faf-bba9-7f50d9c1cd97","resolution":{"observed_at":"2026-08-07T11:23:14.317834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.375874Z","title":"RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Lan- guage Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.375874Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:921d95432d7d407347b41eecaffb88689ff070492de6162d7917d3f822fbd992","observation_id":"f106eb8c-399d-4736-be2e-3d6bc7a9dd8d","resolution":{"observed_at":"2026-08-07T11:23:14.375874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.454649Z","title":"DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.454649Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:a7b5d4636a43c08b160c8c422fe51cd652b35e8d17c516e9fe98d8fc7f8e82ad","observation_id":"9962cfb5-f5b4-4242-9d78-35efb8d775fc","resolution":{"observed_at":"2026-08-07T11:23:14.454649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:14.503544Z","title":"Lmdrive: Closed-loop end-to-end driving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.503544Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:93516a2a61d8ff7accee2367a1f136aec4f86df049787d45868c73480c4e7a3f","observation_id":"ecc36b9e-663c-4f8c-9e43-53724ef1cebb","resolution":{"observed_at":"2026-08-07T11:23:14.503544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:23:15.164006Z","title":"Lingoqa: Visual question answering for au- tonomous driving,","venue":null,"work_id":"5cddc1a3-dbec-419f-90f7-fe2453874917","year":2024},"citing_paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:23:14.558335Z"},"links":{"citing_paper":"/paper/2506.02615"},"observation_digest":"sha256:0b530339693d2e84fba17942e943a84ee9098f4064a33f9887ce335c88f3f72f","observation_id":"0de58213-75e5-4885-9290-f651cc754242","resolution":{"observed_at":"2026-08-07T11:23:15.227697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02615","last_updated":"2025-06-03T08:32:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:17:56.277660Z","submitted_at":"2025-06-03T08:32:43Z","title":"Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.02615."}