{"as_of":"2026-08-08T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b4f6f09249084c7d076c2ef8c4d4b8049b72388d897e56b157c36b4a900c782","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:42:48.527090Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03837/citation-record","integrity":"/paper/2509.03837/integrity","json":"/paper/2509.03837/citation-record.json","paper":"/paper/2509.03837"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:50.254504Z","title":"Artificial General Intelligence (AGI)- Native Wireless Systems: A Journey Beyond 6G,","venue":null,"work_id":"be419e6f-00a9-4f4c-9a2b-50d7385a826f","year":2025},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:46.682072Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:1d677688e511566f80ab47efdb2b792a2714fd5c9607167288c615a538a3f4f8","observation_id":"7661e347-db4e-4686-9caa-9f1ff590eb2b","resolution":{"observed_at":"2026-08-05T10:42:50.339169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:50.129796Z","title":"Joint Sensing, Communication, and AI: A Trifecta for Resilient THz User Experiences,","venue":null,"work_id":"7d4911b6-b89f-4a7c-8519-f50942dad37e","year":2024},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:46.741361Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:5da82717524ad595ecff6c7b21f76e7e886e8c543928565b5ea897109e790205","observation_id":"1eb62e7e-2fe7-4694-a9d1-4df9397e1ca0","resolution":{"observed_at":"2026-08-05T10:42:50.176014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.946388Z","title":"Sensing-Assisted High Reliable Communication: A Transformer- Based Beamforming Approach,","venue":null,"work_id":"a3d33519-b87c-49a1-abc5-8b4940ebac81","year":2024},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:46.826433Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:64069e5fc3102fb473b6202eafe1797db342d99b0494947e85be8e6a0ed0a60a","observation_id":"3955825f-f184-4f05-a21c-3c29af1e81e0","resolution":{"observed_at":"2026-08-05T10:42:50.027458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11811","last_updated":"2023-09-21T06:29:38Z","snapshot_observed_at":"2026-07-06T16:21:37.457918Z","submitted_at":"2023-09-21T06:29:38Z","title":"Multimodal Transformers for Wireless Communications: A Case Study in Beam Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11811","snapshot_observed_at":"2026-08-05T10:42:46.916383Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:46.916383Z"},"links":{"cited_paper":"/paper/2309.11811","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:4f8aaa53916685cf8ec06f6bb6784ab469fa42336205ae123dfbbf4e4123d3a6","observation_id":"7b419d69-ff08-4621-83d0-3bedcc8fadfd","resolution":{"observed_at":"2026-08-05T10:42:46.916383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.805270Z","title":"Vision-Aided 6G Wireless Communications: Blockage Prediction and Proactive Handoff,","venue":null,"work_id":"22dac312-086c-4f4a-b23f-e2020fa617d1","year":2021},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:46.979068Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:7b7a0f6fcb68dfa168b00fd459501be55cda9cbab7d14d6f1c15ffd061fd66d1","observation_id":"5667bcab-5266-4e07-855e-e6878ba03c14","resolution":{"observed_at":"2026-08-05T10:42:49.886913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.668929Z","title":"Passive Radar at the Roadside Unit to Configure Millimeter Wave Vehicle-to-Infrastructure Links,","venue":null,"work_id":"63073318-41fd-4250-8c80-f30d5aacc5f6","year":2020},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.075053Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:2b305ac05c4f55b680b1346b01c2ac8206bd52e995d81c72bc6963ba5007bcb2","observation_id":"697b5786-72d8-47c7-9598-6df083e26354","resolution":{"observed_at":"2026-08-05T10:42:49.746056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10432","last_updated":"2025-06-27T07:52:32Z","snapshot_observed_at":"2026-08-07T17:06:52.040273Z","submitted_at":"2025-03-13T14:55:59Z","title":"BeamLLM: Vision-Empowered mmWave Beam Prediction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10432","snapshot_observed_at":"2026-08-05T10:42:47.149512Z","title":"Zheng, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.149512Z"},"links":{"cited_paper":"/paper/2503.10432","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:3ac047a75f971a5bd55cbb737da021677c396e324bd4e9ca445c3da3526df765","observation_id":"e0a2efc5-5f75-4781-9b54-9e3039174fb5","resolution":{"observed_at":"2026-08-05T10:42:47.149512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.521217Z","title":"LLM4CP: Adapting Large Language Models for Channel Prediction,","venue":null,"work_id":"4ac88558-9430-4f89-a9fe-d152bf109a02","year":2024},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.254853Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:ab1f0d1f2590aaddb4f31d3b731faf28b3083bd5387d8428bb78e2f1b834d90e","observation_id":"8fbda038-5192-4732-bea9-46dde18623d6","resolution":{"observed_at":"2026-08-05T10:42:49.581498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09857","last_updated":"2025-09-01T03:23:46Z","snapshot_observed_at":"2026-08-07T20:14:10.649455Z","submitted_at":"2025-02-14T01:44:57Z","title":"Port-LLM: A Port Prediction Method for Fluid Antenna based on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09857","snapshot_observed_at":"2026-08-05T10:42:47.360252Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.360252Z"},"links":{"cited_paper":"/paper/2502.09857","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:0282d9d4d7e6f4587aadbf834be6a0521369d735b25c35af9b4d88abb6468110","observation_id":"0c398674-2cee-4ea3-98f3-984b53cfc4fb","resolution":{"observed_at":"2026-08-05T10:42:47.360252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T10:42:47.458653Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.458653Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:1b82bfbced266c5fbfe2016355dee0c798b7318839f8518f2a798a838031478d","observation_id":"c860dd26-4d5f-4bfb-88ba-c6d787b66330","resolution":{"observed_at":"2026-08-05T10:42:47.458653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.366037Z","title":"Large Language Models Empower Multimodal Integrated Sensing and Communication,","venue":null,"work_id":"0764d1be-bc95-4036-bf6c-8da51309caa6","year":2025},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.533042Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:ae2917dbebf6c4e72ac315d74f2a1605339584290495a6e0e4b13d7700cc360c","observation_id":"b89035b5-0201-4c0c-9ff5-2e2c1b0fb6d1","resolution":{"observed_at":"2026-08-05T10:42:49.442427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18470","last_updated":"2025-06-11T04:41:29Z","snapshot_observed_at":"2026-07-06T20:42:33.518153Z","submitted_at":"2025-02-04T01:30:06Z","title":"Spatial-RAG: Spatial Retrieval Augmented Generation for Real-World Geospatial Reasoning Questions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18470","snapshot_observed_at":"2026-08-05T10:42:47.639839Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.639839Z"},"links":{"cited_paper":"/paper/2502.18470","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:263e0c6e79ede5e6f98fd4fbacc59954917bffa2edbe705b06392d5e31f65d0f","observation_id":"a70ff868-81ef-4b14-b30e-b0358a998655","resolution":{"observed_at":"2026-08-05T10:42:47.639839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T10:42:47.749665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.749665Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:9c7758d98a1d526afe66732e9d19e5eec550aefbbb6cd4d380e76d6583522855","observation_id":"db04601f-b74a-4f9f-bf04-711e93fad118","resolution":{"observed_at":"2026-08-05T10:42:47.749665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.221055Z","title":"BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird’s-Eye View Representation,","venue":null,"work_id":"63fc4518-2a01-41af-8355-3ceea7327ec0","year":2023},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.879642Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:efd21e8fdfba661dd3a14d7b621126104ce3242cb3c47bcbc39ab564c662fb1c","observation_id":"a5998c3e-1889-4f78-ab29-279feb60abf6","resolution":{"observed_at":"2026-08-05T10:42:49.281872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-05T10:42:47.959381Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.959381Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:ab874639a18192b55c6c925f60bebb00c325f79bd0721699cda1a2127c916f1b","observation_id":"0b72d4ed-8679-4e5f-a2b2-d9c4406ad130","resolution":{"observed_at":"2026-08-05T10:42:47.959381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03938","last_updated":"2017-11-10T17:54:40Z","snapshot_observed_at":"2026-08-03T16:54:06.158198Z","submitted_at":"2017-11-10T17:54:40Z","title":"CARLA: An Open Urban Driving Simulator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03938","snapshot_observed_at":"2026-08-05T10:42:48.041403Z","title":"Dosovitskiy, G","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.041403Z"},"links":{"cited_paper":"/paper/1711.03938","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:61f8b73ae01f0e7e902c41450095e4858a0c7d3ae6954e3a7d39fb0dfbb23a87","observation_id":"de258daa-0b44-4e0d-95ac-a9fccce2c92d","resolution":{"observed_at":"2026-08-05T10:42:48.041403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:48.123049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.123049Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:e9c91a11d29dc3f4c924f43471392677a09c8947b54d018393edaa252e8f01c6","observation_id":"35bc6856-6a6c-435f-8c9c-baacca2566c0","resolution":{"observed_at":"2026-08-05T10:42:48.123049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:49.050802Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customiz- able models","venue":null,"work_id":"0cd18a46-4e18-45be-b243-0eeef1d0b356","year":2024},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.203558Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:01d40e3a6cd2e93256b0b79a8b879b071f66fc6f12d8526df938eb680e5e0ef6","observation_id":"f5ce4959-c9c0-45fb-92f9-845783b3d391","resolution":{"observed_at":"2026-08-05T10:42:49.131525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T10:42:48.288180Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.288180Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:f0b91c98715f651f18b62ccf849f131297e29a52b9855a95c00162d66390421f","observation_id":"202cb994-76c8-49af-ba6d-910b44e7c37a","resolution":{"observed_at":"2026-08-05T10:42:48.288180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:42:48.897398Z","title":"Long Short-Term Memory,","venue":null,"work_id":"fde92a72-31ab-4294-9b20-babbf2160881","year":1997},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.375998Z"},"links":{"citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:8f6a7965016ba27ddfec502b45bf7af8266000317755c1b13b3dd1febdf66492","observation_id":"acc90f7d-326a-4382-b3af-da66c481179d","resolution":{"observed_at":"2026-08-05T10:42:48.986723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-05T10:42:48.461598Z","title":"Chung, C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.461598Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:9590880215291ad15e8c1445f142c7f8a95ae8ac31ac83b353c11408b102006b","observation_id":"64e6b651-f7b1-4f91-907c-3fabaf230c5f","resolution":{"observed_at":"2026-08-05T10:42:48.461598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T10:42:48.527090Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:48.527090Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:44634e00e95870e575aaa1d25ef7791a70c2c04d8590b93623fd92ec788d9605","observation_id":"33df7c63-133b-45d6-bb14-8a8156e47940","resolution":{"observed_at":"2026-08-05T10:42:48.527090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2509.03837."}