{"as_of":"2026-08-08T18:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d737401209cff82268a23886bb3d4ed50aeb0b3ecb9ef02ba3d69411feb53e1","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T20:38:37.565303Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24224/citation-record","integrity":"/paper/2607.24224/integrity","json":"/paper/2607.24224/citation-record.json","paper":"/paper/2607.24224"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.281523Z","title":"Modeling interactions between autonomous agents in a multi-agent self-awareness architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.281523Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:322bf38b08822c4499f08796d6b7adf660345ab19b8ce2e5efbf9fe3b4f3fad9","observation_id":"e64d1923-c86c-4a5d-9140-2d82c2fc6823","resolution":{"observed_at":"2026-07-31T20:38:37.281523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.287458Z","title":"Privacy-concealing coopera- tive perception for bev scene segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.287458Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:7dd4da7e89b1899656a8dec5d8eba151290ce3bca06845fb52898ab62c31ec25","observation_id":"8440c05c-3c91-4856-b17a-528746be26ed","resolution":{"observed_at":"2026-07-31T20:38:37.287458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.292615Z","title":"Nitedr: Nighttime image de-raining with cross-view sensor cooperative learning for dynamic driving scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.292615Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:aa028112bba9778f4ec44929ca7893b0bdcd98f1d5b8391b9255e3120ae1f95d","observation_id":"3ca7f860-fd39-41b9-8904-2375d021849b","resolution":{"observed_at":"2026-07-31T20:38:37.292615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.297921Z","title":"Ubtransformer: Uncertainty-based transformer model for complex scenarios detection in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.297921Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:efcf1ef3a167b7707eaf4586e9f03001b47f0394b60d746bffb934d7266ac5e8","observation_id":"b2c1275c-5e36-465d-95bc-391636c3140d","resolution":{"observed_at":"2026-07-31T20:38:37.297921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.302585Z","title":"Physical adversarial attacks for camera-based smart systems: Current trends, categorization, applications, research challenges, and future outlook,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.302585Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:cf8c6f522f5ec72ac9f3623544f3501a384104f84e13cfc8aa084ff72985aaf4","observation_id":"890ff969-2f36-4564-b3ab-44e8750f5d6e","resolution":{"observed_at":"2026-07-31T20:38:37.302585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.307414Z","title":"Lif-seg: Lidar and camera image fusion for 3d lidar semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.307414Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:3473d75257502c2b6ce516c18359c111deaf535c76088c008cfb0232b7d1daa0","observation_id":"de9cfdee-5272-458f-93f6-9d699031035e","resolution":{"observed_at":"2026-07-31T20:38:37.307414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.312578Z","title":"Synet: A synergistic network for 3d object detection through geometric-semantic-based multi- interaction fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.312578Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:0add2022e718ef1edda92b6c6eeaeb780f425bff59e2d517e7ed5e6cd534914d","observation_id":"229fb365-9e5d-412d-aff8-5adc890f0367","resolution":{"observed_at":"2026-07-31T20:38:37.312578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.316875Z","title":"Multi-sensor fusion and cooperative perception for autonomous driving: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.316875Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:f19c72035d94bbbc9b983d3e90d58f3a6aea5a05b95fc0249206bb7ac46aa03c","observation_id":"65067286-d310-498b-ba96-d6aee888b96c","resolution":{"observed_at":"2026-07-31T20:38:37.316875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.321204Z","title":"Cg-mae: Bev masked autoencoders based on cross-modal guidance for 3d object detection in autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.321204Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:577bd22fff1d88d370fbf166f8bd3bae1ae556e2ac737f1deb80de1d4ef1f476","observation_id":"759276d6-7977-4339-b542-b44ada66d543","resolution":{"observed_at":"2026-07-31T20:38:37.321204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.325363Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.325363Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:83d7a6028d51785d88b5142fa095337853ae8a575a96cf506956373f334f81f0","observation_id":"2626b1f7-859f-4019-ab1b-2ecda03471a2","resolution":{"observed_at":"2026-07-31T20:38:37.325363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.329649Z","title":"Mapfusion: A novel bev feature fusion network for multi-modal map construction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.329649Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:4a2a113f3765042fadf7c88066f9e7cc9548f2af2e7b1bed7d074c5709adcfe0","observation_id":"f0f013fd-9782-42ce-a3f7-8102ff50aef6","resolution":{"observed_at":"2026-07-31T20:38:37.329649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.335356Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.335356Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:a56b486e74c3c0ebfbf010088aec5eb3d1c835aae8dbc6ee75c7cce6885bed6a","observation_id":"d60c57d8-d1be-4e1e-98bb-91f5c9e6ca9a","resolution":{"observed_at":"2026-07-31T20:38:37.335356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.339611Z","title":"Mta: Multimodal task alignment for bev perception and captioning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.339611Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:9b6b9e9ae74a766bd06b160d7239be7ff1b40bdeb89ea13da794e58d11ddfa92","observation_id":"bedfc64e-e907-4c78-89b6-47aa0557ae82","resolution":{"observed_at":"2026-07-31T20:38:37.339611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.343995Z","title":"M3net: Multimodal multi-task learning for 3d detection, segmentation, and occupancy prediction in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.343995Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:feac9e1ef1c2e7f4c755f48833f60ea4f23c896e3bfdb4e81ad4f70196b250d3","observation_id":"6a59ece2-7293-45b8-b5d0-36daf918b63d","resolution":{"observed_at":"2026-07-31T20:38:37.343995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.348141Z","title":"Fuller: Unified multi-modality multi-task 3d perception via multi-level gradient calibration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.348141Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:75de1a0f9d7e57993a41313ac9878b5cb6934464d7d4f7200735c7ac1dc22220","observation_id":"c8fe9a96-a2e6-4f93-a78c-7840926c2a16","resolution":{"observed_at":"2026-07-31T20:38:37.348141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05088","last_updated":"2022-04-19T05:40:19Z","snapshot_observed_at":"2026-07-06T12:58:57.155515Z","submitted_at":"2022-04-11T13:43:25Z","title":"M$^2$BEV: Multi-Camera Joint 3D Detection and Segmentation with Unified Birds-Eye View Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05088","snapshot_observed_at":"2026-07-31T20:38:37.352420Z","title":"M2bev: multi-camera joint 3d detection and seg- mentation with unified birds-eye view representation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.352420Z"},"links":{"cited_paper":"/paper/2204.05088","citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:71f000bbf0e71102614d0ae46594f59a498900db9c0ac778423867a275e96089","observation_id":"b092e448-5338-4472-9cde-e962bac1be24","resolution":{"observed_at":"2026-07-31T20:38:37.352420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.357929Z","title":"Unitr: A unified and efficient multi-modal transformer for bird’s-eye- view representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.357929Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:85915ca3bfa5a0237a9fbd50b33b159e1c45ae2cba9bf8ab17ef7f43505d173c","observation_id":"469c5d0a-cc65-4d49-84d2-2ed33cccd50f","resolution":{"observed_at":"2026-07-31T20:38:37.357929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.362343Z","title":"Maskbev: Towards a unified framework for bev detection and map seg- mentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.362343Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:22f5f6377f19cff5d82b11e0b6f89682d24494b7666b49e19ac51eb40dd70ae8","observation_id":"4579b44b-b931-4409-b68d-5a6ead173116","resolution":{"observed_at":"2026-07-31T20:38:37.362343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.366717Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.366717Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:16bb51c5fad38f6ee62e13fa6fc2427e663ca875397e1947df070b405e9de655","observation_id":"a42ce000-adde-4a51-9e7e-88c117f2fb7d","resolution":{"observed_at":"2026-07-31T20:38:37.366717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.371325Z","title":"Deep learning for 3d point clouds: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.371325Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:22cd42030d75ea6bb0376dd43c34fc2fbb4e7afaefc55c12c7af7e1f5dd12f69","observation_id":"da11ec59-1e35-47db-814c-eaa454b91a4b","resolution":{"observed_at":"2026-07-31T20:38:37.371325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.375437Z","title":"Automotive radars: A review of signal processing techniques,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.375437Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:7be85ba0b5f4920a0aaa46d9752efaaf75a8bd700ff0a1e8bc19ef3bbe422366","observation_id":"846b80c6-9595-4eeb-8a48-687999043179","resolution":{"observed_at":"2026-07-31T20:38:37.375437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.379897Z","title":"Static multitarget- based autocalibration of rgb cameras, 3-d radar, and 3-d lidar sensors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.379897Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:08d64a75844655f4ef843171d4a7efb47190244b2f908e338f7e768dbfe20157","observation_id":"0656571f-d805-4534-8683-37b4488687a6","resolution":{"observed_at":"2026-07-31T20:38:37.379897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.384276Z","title":"High dimensional frustum pointnet for 3d object detection from camera, lidar, and radar,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.384276Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:cc5e1ccf2822ec233bff1dc28975af66d250d85439e45a749193101dafecd864","observation_id":"a3101ce2-24d0-47f4-ba58-ccb4ce82025e","resolution":{"observed_at":"2026-07-31T20:38:37.384276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.389054Z","title":"Ezfusion: A close look at the integration of lidar, millimeter-wave radar, and camera for accurate 3d object detection and tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.389054Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:1f33ee9a8ae4258ac36c56db0356ef40b74dddcdcbd2544d5055e7de8bf44cfd","observation_id":"4bb97308-05d1-4692-af81-355b95224161","resolution":{"observed_at":"2026-07-31T20:38:37.389054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.393779Z","title":"Camera, lidar, and radar sensor fusion based on bayesian neural network (clr-bnn),","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.393779Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:c9fabb5ef4aac3489a217d72319246a0d7bd395ae05060ae19dda60058a57848","observation_id":"90675b89-f8ed-4296-9fdb-7ec7fffd4cba","resolution":{"observed_at":"2026-07-31T20:38:37.393779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.398551Z","title":"Mt-detr: Robust end-to-end multimodal detection with confidence fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.398551Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:b72c64d1e7ab2af6bda4fdbdf8100aa9abd85a51042d8e4cbbec0c543a47efbc","observation_id":"9d803f52-58a1-4609-a425-db4c6a2a427d","resolution":{"observed_at":"2026-07-31T20:38:37.398551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.402868Z","title":"Rcm-fusion: Radar-camera multi-level fusion for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.402868Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:53c888f6bab22dc0e184b77af4d02551dd7d1a242e4367e1b63586f9048c272b","observation_id":"8533b8b2-b7c9-44ea-8287-cb44645d9a92","resolution":{"observed_at":"2026-07-31T20:38:37.402868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.407305Z","title":"Bridging the view disparity between radar and camera features for multi-modal fusion 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.407305Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:ee9c41a12c2eb619ba610d6b3ee177a59ab33c2106f2a4ce274761e9438acfb6","observation_id":"d52f972b-3d8c-4481-bfb9-6f33478c2d0c","resolution":{"observed_at":"2026-07-31T20:38:37.407305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.411306Z","title":"Simple- bev: What really matters for multi-sensor bev perception?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.411306Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:29a4ac9b16a340a59af521577ced9abbd6e4e025ac53f3357f867f8f666f229c","observation_id":"342399fa-24e9-48a5-96ca-6d42f9e0803b","resolution":{"observed_at":"2026-07-31T20:38:37.411306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.415356Z","title":"Multifusionnet: Spatio-temporal camera-radar fusion in dynamic urban environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.415356Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:a59868fa1783ab4d0faee15bb441ca0831affffe30aeb5f04ffc9e6e49c2a890","observation_id":"46cb9254-40e6-44d1-8b11-8831a854f732","resolution":{"observed_at":"2026-07-31T20:38:37.415356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.419640Z","title":"Rcbevdet: Radar-camera fusion in bird’s eye view for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.419640Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:546e24c68ab818c17e540c3df6d064f7f75b0700a2e013ae0dc8826c34af6588","observation_id":"460fe63d-f648-4151-aed9-d4cc09e0f6ad","resolution":{"observed_at":"2026-07-31T20:38:37.419640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.424011Z","title":"Eliminating cross-modal conflicts in bev space for lidar-camera 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.424011Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:085c9d341c678cde3dc535748c9ab068b6947532988484651bedc8fb94ec3177","observation_id":"31f780ea-a013-4d8a-bda3-9ec112e9667f","resolution":{"observed_at":"2026-07-31T20:38:37.424011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.428283Z","title":"Henet: Hybrid encoding for end-to-end multi-task 3d perception from multi-view cameras,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.428283Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:2c5caf48b58e41d765e7ab693ae6ea70cd51eedbeda456f192b3747349252be2","observation_id":"db4f40f0-faaf-4c2d-a5b2-20bf94051042","resolution":{"observed_at":"2026-07-31T20:38:37.428283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.432247Z","title":"Adversarial multi-task learning for liver tumor segmentation, dynamic enhancement regression, and classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.432247Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:af02ca965b06113224c6e43a32f377541a6e91792d2b30659f09d7af3427d228","observation_id":"0862b9e5-7961-4018-840d-d1eb7f45e6db","resolution":{"observed_at":"2026-07-31T20:38:37.432247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.436420Z","title":"Quadbev: An efficient quadruple-task perception framework via birds’- eye-view representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.436420Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:d6ed106f8905d3ad6e358fb32074d9ec64ee36e62c4da16d1c926b907cd69322","observation_id":"e849de77-3455-455e-b517-faa577495701","resolution":{"observed_at":"2026-07-31T20:38:37.436420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.441010Z","title":"Msc-bench: Benchmarking and analyzing multi-sensor corrup- tion for driving perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.441010Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:d96a7e6032f1583009c925372e89564d1d5676ffb0a3ae1333299695eae296f2","observation_id":"7cbf1193-167e-4d05-b287-ef5e2acbaa36","resolution":{"observed_at":"2026-07-31T20:38:37.441010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.445261Z","title":"Sgformer: Semantic-geometry fusion transformer for multi-modal 3d panoptic segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.445261Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:0b03bbed8ca63cb93f4756f6fe495085598457c12587dc3e169ca24a8a7e622d","observation_id":"65542c8e-b448-4b02-af85-c988d8694193","resolution":{"observed_at":"2026-07-31T20:38:37.445261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.449615Z","title":"Graphbev: Towards robust bev feature alignment for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.449615Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:30eda93f80d656683c1f8e590ffae51f593de8d3153d7147356c6108c5f69e35","observation_id":"09fde5e4-fc1f-436f-9ed5-eb3582c883af","resolution":{"observed_at":"2026-07-31T20:38:37.449615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.454132Z","title":"Cmgfa: A bev segmentation model based on cross-modal group-mix attention feature aggregator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.454132Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:1fa6ea2eb5103cb524926da7569bcbb6dd1e1639823890a5090730cabf7355ef","observation_id":"87488360-d215-4f39-a3a6-b7dc2a2392b3","resolution":{"observed_at":"2026-07-31T20:38:37.454132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.458545Z","title":"Filter-based deep-compression with global average pooling for convolutional net- works,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.458545Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:8e74ab5dcf8919e6a3b54c3124ed3fbaefeb0ec68f3c1faa80021fb8ee66d763","observation_id":"43cbca86-7873-42a3-aa25-eb6325a5d6f1","resolution":{"observed_at":"2026-07-31T20:38:37.458545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.462783Z","title":"Convolution in convolution for network in network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.462783Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:684a9aa640a2586505e3998b135a66ac9c54eb601e05314140cff8bc1d59e55a","observation_id":"c455d966-28be-42f5-b98d-f6c3fa5ee43b","resolution":{"observed_at":"2026-07-31T20:38:37.462783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-07-31T20:38:37.467203Z","title":"Deep learning using rectified linear units (relu),","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.467203Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:ae7efcd64d38bb6898709840a191c3fa48044fc3cb5a83711f548c39d9170631","observation_id":"9612e762-e08c-4c7d-ba0f-5069fb06c5a0","resolution":{"observed_at":"2026-07-31T20:38:37.467203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.472536Z","title":"Adaptive mixtures of local experts,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.472536Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:9d4f34b66211caa90ba695ca1b7f5a0cd71d5a85e7f321349ceea9451c96ba09","observation_id":"073e0bf3-7600-49df-ba54-47b9c0ee4882","resolution":{"observed_at":"2026-07-31T20:38:37.472536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.477016Z","title":"Long-tailed recog- nition by routing diverse distribution-aware experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.477016Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:05226833d689369d1f2b5a136bfefc131170c1809d3c6e7c7ac4e3244b76d9f4","observation_id":"f1df9848-08b4-421c-be04-3edf93d31347","resolution":{"observed_at":"2026-07-31T20:38:37.477016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.481350Z","title":"Adamv-moe: Adaptive multi-task vision mixture-of-experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.481350Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:3f34fc79e502a928a9350ed1a6a0432227b90261df533f91e5c645287fce9b51","observation_id":"b27d6334-6f30-4e0b-af3f-806c6c46372d","resolution":{"observed_at":"2026-07-31T20:38:37.481350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.485848Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.485848Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:b21bc815e1f15461452b05fc75d8f9a7498dd879d616e2b310f451b8f070703c","observation_id":"3838c5da-951b-427f-81d7-8386f291a2ca","resolution":{"observed_at":"2026-07-31T20:38:37.485848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.490051Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.490051Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:0ebbfecb057bd0680c55a19c0de028701cb055467d2c22f06d4c8ce44c5dc452","observation_id":"50f3f963-108b-4839-bf13-b2219372563e","resolution":{"observed_at":"2026-07-31T20:38:37.490051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.494673Z","title":"X-align: Cross-modal cross-view alignment for bird’s-eye-view segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.494673Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:bae4e891fa728104b55ab4634daf5522332d52a09b3b4e926bbc40a6ba552a7a","observation_id":"d62c801e-65c9-4258-96f9-ba622f3955b9","resolution":{"observed_at":"2026-07-31T20:38:37.494673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.499116Z","title":"Bevformer: learning bird’s-eye-view representation from lidar-camera via spatiotemporal transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.499116Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:5c02b6db14be6bdc8577b541ed4f5fffc143a5e93295826f487c0c2a655b3091","observation_id":"01295c1f-93ec-4ecb-9cb3-79f37c128e1a","resolution":{"observed_at":"2026-07-31T20:38:37.499116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.503273Z","title":"Pointpillars: Fast encoders for object detection from point clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.503273Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:d3937eb78a6fcce4567bd3ef4b649c182a0207a227de5bb15589ebf32d11a020","observation_id":"0d7d8dc8-4153-4348-bd39-cd65250b1900","resolution":{"observed_at":"2026-07-31T20:38:37.503273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.507329Z","title":"Center-based 3d object detection and tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.507329Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:73edfe9bb78bfb27e8ef347a09b192a2c4d883dfbe7328d8ec4d47fc77f8e22b","observation_id":"3d3a5b56-2685-468f-8fbc-6864432b576c","resolution":{"observed_at":"2026-07-31T20:38:37.507329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.511957Z","title":"Focalformer3d: focusing on hard instance for 3d object JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2015 12 detection,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.511957Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:29a1b2898cd3494cf8c3e286dd66308c6962d128d19cf55758501cfaf6c52172","observation_id":"0675447a-5a47-4064-a529-0986c4443754","resolution":{"observed_at":"2026-07-31T20:38:37.511957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.516216Z","title":"Safdnet: A simple and effective network for fully sparse 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.516216Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:15e13227ea0ba3a728d2d6d67d95ec8de53e11aa5d8d8fed639aa51b1da8c103","observation_id":"e2283725-a02b-44a5-afb7-94f6a5becb31","resolution":{"observed_at":"2026-07-31T20:38:37.516216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.520508Z","title":"Pointpainting: Se- quential fusion for 3d object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.520508Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:94be84fbeec2b627ab186e6030072ee95fbfab10a017e792ec73f45840a00892","observation_id":"81497507-0f8d-42e5-8533-5089d8b19347","resolution":{"observed_at":"2026-07-31T20:38:37.520508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.524956Z","title":"Futr3d: A unified sensor fusion framework for 3d detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.524956Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:690b96716f821ca193151150baeb9d01e090c061bdd012d92db818f0f11f3c6b","observation_id":"86c311eb-dec4-40e6-90f7-1eda61f53ff0","resolution":{"observed_at":"2026-07-31T20:38:37.524956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.529684Z","title":"Multimodal virtual point 3d detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.529684Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:c3d0e0acdab51e23279b2ab26b6c5de8b922d0fb095b5e68fa25a23a856971aa","observation_id":"f7eb9173-a257-4fc9-b83e-78464ffa692a","resolution":{"observed_at":"2026-07-31T20:38:37.529684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.534445Z","title":"Mbfusion: A new multi-modal bev feature fusion method for hd map construction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.534445Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:81743b4214b4171d6445f9f5937f673d7288c647fbadc2a46b7a3dfa5c1e75fb","observation_id":"755e74f2-fef4-45cd-a98b-2810c678b7e5","resolution":{"observed_at":"2026-07-31T20:38:37.534445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.539018Z","title":"Maptr: Structured modeling and learning for online vectorized hd map construction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.539018Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:fa0c8a01a09c00bd1a673b0ad451e656b50e31f9a7027d5025faf6304608a657","observation_id":"42b8c2e3-d8b7-46f9-bc55-550ac56570dd","resolution":{"observed_at":"2026-07-31T20:38:37.539018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.543137Z","title":"Smab: Simple multimodal attention for effective bev fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.543137Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:6d7e2aa22c4e39ed96a3124c27407a5acbd19d1c6ad788cf474fca99b20a1083","observation_id":"b7c271ee-abcf-4f79-93f5-02d0e392547b","resolution":{"observed_at":"2026-07-31T20:38:37.543137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.547685Z","title":"Henet++: Hybrid encoding and multi-task learning for 3d perception and end-to-end autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.547685Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:6181623821abaa643b5a9982afb9d80f4cdd54e62487ca5d56a537bdb61d3640","observation_id":"c4e29177-7dad-405d-88bf-9799b006a4de","resolution":{"observed_at":"2026-07-31T20:38:37.547685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.552206Z","title":"Unisparsebev: A multi-task learning framework with unified sparse query for autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.552206Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:187a3bedd6c0c8bae12b6b4828d0d0bf6c3303f765f756326cb41ae8a26d5703","observation_id":"c2224070-e2e8-458e-8bc4-bb74a8152c2d","resolution":{"observed_at":"2026-07-31T20:38:37.552206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.556848Z","title":"Daocc: 3d object detection assisted multi- sensor fusion for 3d occupancy prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.556848Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:6d404a249bbc9eccb0f640b84f028380ac16afe817d9651e14ee3ba335519957","observation_id":"56df480d-4e37-45a6-a178-df4b0ae6125b","resolution":{"observed_at":"2026-07-31T20:38:37.556848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.561341Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.561341Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:89e2da27640e09910d3a2a1ffa9631020eb2872a583dd6eb2752bd0399439051","observation_id":"d1c430d8-29d9-4b82-a2df-fc36d08a9f65","resolution":{"observed_at":"2026-07-31T20:38:37.561341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T20:38:37.565303Z","title":"Super-convergence: Very fast training of neural networks using large learning rates,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T20:38:37.565303Z"},"links":{"citing_paper":"/paper/2607.24224"},"observation_digest":"sha256:19b0a8bb197fe6f9bd6db64df7b1f1f9267148c57f78dab64f7fc09f1682c6e5","observation_id":"c2eb1ac7-f140-42f4-8418-aecf9fa6e9af","resolution":{"observed_at":"2026-07-31T20:38:37.565303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24224","last_updated":"2026-07-27T09:57:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T21:51:53.624969Z","submitted_at":"2026-07-27T09:57:56Z","title":"MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2607.24224."}