{"as_of":"2026-08-07T08:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55949540af4062407a0b619c745bd3da3a3b75995f9c97d6f15e2053329afb7a","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:33:26.603654Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07938/citation-record","integrity":"/paper/2507.07938/integrity","json":"/paper/2507.07938/citation-record.json","paper":"/paper/2507.07938"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:24.489572Z","title":"A survey of autonomous driving: Common practices and emerging technolo- gies,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:24.489572Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:76884b6e9896b8573418cda27a0ed8f9282748882178e86e90145f232492a0df","observation_id":"20539d96-2825-4042-a2bb-3fb6e3d6b48d","resolution":{"observed_at":"2026-08-06T18:33:24.489572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12345","last_updated":"2023-10-18T21:43:37Z","snapshot_observed_at":"2026-07-06T16:35:19.728025Z","submitted_at":"2023-10-18T21:43:37Z","title":"ClusT3: Information Invariant Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12345","snapshot_observed_at":"2026-08-06T18:33:24.607371Z","title":"Safety-enhanced autonomous driving using interpretable sensor fusion transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:24.607371Z"},"links":{"cited_paper":"/paper/2310.12345","citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:c99bad613c2342d60b260266426ad8327619b345e220347547d684ed11e0831c","observation_id":"8520d665-ff66-47ee-8dbd-4e72f7cb95e7","resolution":{"observed_at":"2026-08-06T18:33:24.607371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:24.769558Z","title":"Planning-oriented autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:24.769558Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:1452a9848f973c8f1d0f54e1d03a07354b7e85b4e9888fc91fc954f78adc7735","observation_id":"f82fddac-1ecb-415b-9d97-1fe8922bc95b","resolution":{"observed_at":"2026-08-06T18:33:24.769558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.29708","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:27.781087Z","title":"Deep multi-modal object detection and semantic segmentation for au- tonomous driving,","venue":null,"work_id":"f98a6eaa-0f74-4945-956f-7441fb99c647","year":2021},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:24.896397Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:f32b89edf384a0adec28d8ab39ab50abf97fa7fa01615c42bbd3a3bb9ce26087","observation_id":"6c117f6c-590a-4b39-85ec-4e8a6c0c984d","resolution":{"observed_at":"2026-08-06T18:33:27.877104Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.053146Z","title":"Ex- plainable artificial intelligence (XAI),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.053146Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:89d0544779d3b5feb6d162d15c55b4fe4b2ce66714de21dfd4ce62fa1356785f","observation_id":"7e43c368-c3a3-400b-b3cd-23fdfd13c3fc","resolution":{"observed_at":"2026-08-06T18:33:25.053146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.10446","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:27.518877Z","title":"Why did the AI make that decision?,","venue":null,"work_id":"b1339a0c-96b1-41f0-9880-e7cebebc99a8","year":2024},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.148590Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:71c6f9a691b68d6cb60ff7d37386a428624d4bfec22059e8b50fba91ec28679e","observation_id":"2a9fe5ed-4484-4588-930e-de14a4d03178","resolution":{"observed_at":"2026-08-06T18:33:27.596507Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.251827Z","title":"Ex- plainable artificial intelligence (XAI),","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.251827Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:9cb5277c7b51a30e439aaabe5e5bbe6515940cd702a968f04a0f82e405e12fe9","observation_id":"71590303-b49f-48f7-9bed-69c9d9e00b4d","resolution":{"observed_at":"2026-08-06T18:33:25.251827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.417228Z","title":"Interpretable autonomous driving: A sur- vey of recent advances,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.417228Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:87221ede9bb9b7e144e35797ef36eb3311392c18a1ccd60fee2c29977ddafc73","observation_id":"45f9e0cd-7f03-410d-b6de-9df6a1259202","resolution":{"observed_at":"2026-08-06T18:33:25.417228Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.485181Z","title":"Attention- based multimodal framework for au- tonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.485181Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:a0331b83166960a62bfffb0afd50f3f6853999cb5489eeee157ae54a0bf0801c","observation_id":"63ae09ef-8a4d-4c8b-af86-25bb78cb87e8","resolution":{"observed_at":"2026-08-06T18:33:25.485181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.565184Z","title":"DeepDriving: Learning affordance for direct perception in autonomous driving,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.565184Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:101a8fa6780d4a534fb036e37b3650af53f8c316ff2b6dc0e837fae39084d3ea","observation_id":"bbbe183c-1677-42ea-b03b-7709cd130195","resolution":{"observed_at":"2026-08-06T18:33:25.565184Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03938","last_updated":"2017-11-10T17:54:40Z","snapshot_observed_at":"2026-08-03T16:54:06.158198Z","submitted_at":"2017-11-10T17:54:40Z","title":"CARLA: An Open Urban Driving Simulator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03938","snapshot_observed_at":"2026-08-06T18:33:25.619982Z","title":"CARLA: An open urban driving simulator,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.619982Z"},"links":{"cited_paper":"/paper/1711.03938","citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:a450bca2b1bd101e877e671c6e2f271b3b5d1a0eafa16048c8c39852c496e2c6","observation_id":"fdfd001c-ed76-4d3c-8e29-360eeecfa416","resolution":{"observed_at":"2026-08-06T18:33:25.619982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-05T00:36:47.095250Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T18:33:25.677404Z","title":"VideoMAE: Masked autoencoders are data- efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.677404Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:6fea8c91464695127d6d05bdefe483485b5da8dfd807f5d398b35f962d1f6028","observation_id":"13d5428e-6ba5-44f3-9677-ad9af44217c8","resolution":{"observed_at":"2026-08-06T18:33:25.677404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.751970Z","title":"BERT: Pre-training of deep bidi- rectional transformers for language under- standing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.751970Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:1a5b10a83007a3cf0df435f655381e7aacf2103429af80671cf519de95b87818","observation_id":"62b49ade-ec11-4b84-97cf-ba2a095ad09f","resolution":{"observed_at":"2026-08-06T18:33:25.751970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:25.938197Z","title":"nuScenes: A mul- timodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:25.938197Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:6a462150fe465b3b385cda728dbde2a31bfd78f592965bd6baa44523f6c732f2","observation_id":"07b0436b-7af7-4f2d-b463-bff89e3a65bc","resolution":{"observed_at":"2026-08-06T18:33:25.938197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:26.045042Z","title":"BART: Denoising sequence- to-sequence pre-training for natural lan- guage generation, translation, and com- prehension,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.045042Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:b0e6498446400fbb22f4ad06d913be5512793c62802f11ffd9e4de5a6f54f296","observation_id":"d66212bc-28ca-4069-88b0-d919a9919170","resolution":{"observed_at":"2026-08-06T18:33:26.045042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:26.182936Z","title":"Language-augmented Bird’s-eye View Maps for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.182936Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:cf315b28eb82bf65fbf5a02ff4cce23e88d30ac7651f0817a9fb833a1fceac9f","observation_id":"5f648b4d-208e-469f-bbe9-b5e6a4e582f2","resolution":{"observed_at":"2026-08-06T18:33:26.182936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32567","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:27.022067Z","title":"Vi- sual question answering and natural lan- guage explanations for autonomous driv- ing,","venue":null,"work_id":"e5bec989-d283-420c-b097-2038f6fceebe","year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.293828Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:09feb0212c4dd339d18f8e55a9cc71bc1b4ca65d11945c46e0845dcc29d6c5ff","observation_id":"059c3613-b99e-4c49-a31e-bcee2249e905","resolution":{"observed_at":"2026-08-06T18:33:27.076617Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12345","last_updated":"2023-08-25T22:51:00Z","snapshot_observed_at":"2026-08-02T22:56:44.331922Z","submitted_at":"2023-08-25T22:51:00Z","title":"Antagonising explanation and revealing bias directly through sequencing and multimodal inference","version":1},"cited_work":{"arxiv_id":"2309.12345","doi":"10.48550/arxiv.2309.12345","metadata_source":"pith","pith_arxiv_id":"2309.12345","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Antagonising explanation and revealing bias directly through sequencing and multimodal inference","venue":"cs.HC","work_id":"38c5f74b-738d-4047-b7c1-fc831cffe188","year":2023},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.341130Z"},"links":{"cited_paper":"/paper/2309.12345","citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:30917ecb39bdb187c87fb0259d0558b2f00a3fc699b181adf0eb3ab2f422e1e3","observation_id":"0ad41744-5391-44a0-8385-d63e9f736a87","resolution":{"observed_at":"2026-08-06T18:33:26.829568Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:28.532389Z","title":null,"venue":null,"work_id":"42840cd0-1a49-414f-897c-4f1d65250801","year":2009},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.410084Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:f5c29ba25335a175ab1efdf397caa1c50e44f983f8194d0fdf810327d420f375","observation_id":"b7c750e8-da9a-4a73-90ee-405e352b7312","resolution":{"observed_at":"2026-08-06T18:33:28.597555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:28.360078Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"2814d89f-15c0-4283-8ffe-9441947ec90e","year":2004},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.474538Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:12cb513758fa2379b0088ba26672fc92d471ff5631da5860dc08801233c759bd","observation_id":"6f7ac32a-f619-4442-8762-8e0c5f5a6ff2","resolution":{"observed_at":"2026-08-06T18:33:28.484960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:33:28.124206Z","title":"METEOR: An automatic metric for MT evaluation with im- proved correlation with human judgments,","venue":null,"work_id":"81fb5827-e465-4c80-a711-fd5b91a4b0a2","year":2005},"citing_paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:26.603654Z"},"links":{"citing_paper":"/paper/2507.07938"},"observation_digest":"sha256:050b9f2ba19aac8895f718ea5ce64428fcfdf1515b13bdf42681452897bbbec0","observation_id":"1a763c5f-6605-4540-8378-1459416a7ed9","resolution":{"observed_at":"2026-08-06T18:33:28.231684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07938","last_updated":"2025-07-10T17:21:35Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T06:01:29.435755Z","submitted_at":"2025-07-10T17:21:35Z","title":"Multimodal Framework for Explainable Autonomous Driving: Integrating Video, Sensor, and Textual Data for Enhanced Decision-Making and Transparency"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":2,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2507.07938."}