{"as_of":"2026-08-07T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f69f527a2c4b03c7deac25b3b4cf1130322b17ce98291ed505b9464faa23dae0","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:45:22.211214Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12795/citation-record","integrity":"/paper/2507.12795/integrity","json":"/paper/2507.12795/citation-record.json","paper":"/paper/2507.12795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:15.926372Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:15.926372Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:93429b0b6d49146bf1d8278e201f8bacea2dbe59cf1e0aaa7e9143c95c83d7ca","observation_id":"5cabfe07-63dc-48c1-b12f-7fa7fdfbfa8f","resolution":{"observed_at":"2026-08-06T16:45:15.926372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:15.975258Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:15.975258Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:4e4a20aa77fe7ddf10cfede0081873a9be6855a0385a6ca163bfa40327725c64","observation_id":"9163f18f-439f-4a1a-a367-891709a131d9","resolution":{"observed_at":"2026-08-06T16:45:15.975258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:32.376627Z","title":null,"venue":null,"work_id":"024d1574-515c-4260-91b3-b1fc1b13dfef","year":2018},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.097689Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:30916b2d49c4de11c17da6e676b5b8ff4ce9803bc614f79b324721ac9c87292b","observation_id":"40ac0bb8-09e1-44fb-827c-3c79499f9bbd","resolution":{"observed_at":"2026-08-06T16:45:32.459867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:32.199086Z","title":null,"venue":null,"work_id":"1a24645c-adb4-4a3d-80df-6533f352a525","year":2016},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.188899Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:cc9358eba952f56fd3b4dc868c48c754f59e061e04ad939fe717a4affd64c5fc","observation_id":"b5560e39-d534-4b24-af6b-44976c3c188c","resolution":{"observed_at":"2026-08-06T16:45:32.277131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:32.082157Z","title":null,"venue":null,"work_id":"02048adb-1711-47fa-abe0-e0a1d0a93a48","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.236723Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:8db1ec1e96bb69ff4bba9db29b2f1892c015550e89fee2b8452a678d621c8d62","observation_id":"4c8d87c2-0e6d-44fd-bfd2-2b9db1df90f0","resolution":{"observed_at":"2026-08-06T16:45:32.126470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T16:45:16.290157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.290157Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:0b70e5ba0f26d4fd2a39421b8e57d549935e83a938de6b11f38654af64fd6ed6","observation_id":"2ff4600c-d785-4286-bda9-0ecdb7dd4e1b","resolution":{"observed_at":"2026-08-06T16:45:16.290157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T16:45:16.361628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.361628Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:fd8dc55dd48b0d580667c84a94ba8ee4d5b1cd8578cd38d0a0d58e6fa6b41ba2","observation_id":"bc08b78f-8287-468c-921d-e252b132bbbc","resolution":{"observed_at":"2026-08-06T16:45:16.361628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.427392Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.427392Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:33803ed76726f361184e98fdcf0c4601d5b3f18966e2103df3382112780ca808","observation_id":"e2f454b3-038f-4251-a997-969bce55cd74","resolution":{"observed_at":"2026-08-06T16:45:16.427392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.486408Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.486408Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:abde7580ad6d9186f6a88a39d9231c8db9d5b8cd08bf78761bf13765f314ef8e","observation_id":"29fd16d8-2ba8-4a4c-a769-21156eceb1ac","resolution":{"observed_at":"2026-08-06T16:45:16.486408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.919420Z","title":null,"venue":null,"work_id":"bc1be173-16ce-4c2d-96ab-6260e1b1c877","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.567081Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:cf34da1c562d9dad24277cdb72998223b5feaf322ea4a05cef8c4290d04e1e07","observation_id":"f3a1ae20-f413-4678-9e02-e6f4dff14dc8","resolution":{"observed_at":"2026-08-06T16:45:31.982521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.788428Z","title":null,"venue":null,"work_id":"17e1cd10-154f-4f3d-ac6a-f23b58baf5d6","year":2017},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.622039Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:55ffe76f7aece63573814a6363c5c1d78b596b3e862af28e2cfe4cd5d94bbb90","observation_id":"58f04d5b-aff1-4d99-a176-4c54f1b802a0","resolution":{"observed_at":"2026-08-06T16:45:31.857384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.612957Z","title":null,"venue":null,"work_id":"6e5bbf42-12ad-4ccf-90e8-bdbbdf3545e6","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.689807Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:55f89056206338789f0a9c4c459d06086fd3bfe31ce15b027d6e6c2f9efeb313","observation_id":"1bf11dc2-c795-429d-bb25-ae0afead40ca","resolution":{"observed_at":"2026-08-06T16:45:31.693296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.761439Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.761439Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b6ed2050031af641b13fdec1439088b977b97fd77bb3ec3028066c1d8aa1126a","observation_id":"b476bbed-a8e6-413d-a0d8-1f68d48f37c2","resolution":{"observed_at":"2026-08-06T16:45:16.761439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.465283Z","title":null,"venue":null,"work_id":"15e24048-992b-4b8e-8148-72443dab15e4","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.831029Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6a4544808443014cff4cc4255227e3a498036b9e5762a746c570c8dc04bce8e3","observation_id":"cf447c39-d028-4f96-9bae-a35147654b58","resolution":{"observed_at":"2026-08-06T16:45:31.536118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.317369Z","title":null,"venue":null,"work_id":"7d8e16aa-d08c-4c30-a6e8-11390b7ab8c0","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.908282Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:7881fd9aeaf02adbc86d798c2dc58b81b3bed57f8a312f60f129a7b7b372affd","observation_id":"07a187f7-216a-41b9-a1ce-181377c4166f","resolution":{"observed_at":"2026-08-06T16:45:31.377050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.983920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.983920Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:47b0ddc07c2a49f3d7b34ca810c501a30c05e222a4e84b1122ab65ea5a6b2801","observation_id":"b8aaf4a4-635a-4a5e-a68c-38c61828479c","resolution":{"observed_at":"2026-08-06T16:45:16.983920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:17.050661Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.050661Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:af488b1c9548c72bd4f200433fa198084c5efe3376be11fdd43cf9c4cbba704a","observation_id":"c3b18ace-0b03-4f55-8dcb-2be2dee8a3d5","resolution":{"observed_at":"2026-08-06T16:45:17.050661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T16:45:17.142840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.142840Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:ef6cadf643e318d4c591adb7bb3de58f1049ed8149165b978a56fe60288cfc07","observation_id":"8cefdd84-1cc7-457e-ad78-8eef5455f46f","resolution":{"observed_at":"2026-08-06T16:45:17.142840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.174777Z","title":null,"venue":null,"work_id":"1063dbc9-88d8-4ffa-8f2b-3284a37e95b7","year":2019},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.210296Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:3762e66879f4d9b19b239b46ad5cdddd4ec0fa13cbaa77f44169849bbeed9cad","observation_id":"eb96e898-2e73-48e9-a1ee-d63c58d7f44e","resolution":{"observed_at":"2026-08-06T16:45:31.230235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T16:45:17.284784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.284784Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:70e6ee81a5baa9273922421484d09966d51e2cc7d033777073629fd45cf59d85","observation_id":"8b6e5fd5-a0ee-46f9-bd5a-29ae0e100fd0","resolution":{"observed_at":"2026-08-06T16:45:17.284784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:31.047546Z","title":null,"venue":null,"work_id":"d0648cc4-d552-4162-9d27-2e7fb1f04d65","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.375198Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:70fff2af838f782859fd16749496f7d93c131e0595500fbee1f146c54fa9b048","observation_id":"aa327707-65a5-456f-9818-c42f7c8a87c7","resolution":{"observed_at":"2026-08-06T16:45:31.089876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T16:45:17.450944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.450944Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:4ecc59086f1c2a59571b33ec1c905ad036ae3669501e456819b33053a14c14f3","observation_id":"4ce50cf9-d531-4676-87af-641df8bb2212","resolution":{"observed_at":"2026-08-06T16:45:17.450944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:17.516954Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.516954Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e287db20ff54d04750484fee25493b5b72bf48fb51371d95c04666160231a8f6","observation_id":"077ddc26-e83e-4d8b-9767-af521eb6f5a1","resolution":{"observed_at":"2026-08-06T16:45:17.516954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.923229Z","title":null,"venue":null,"work_id":"34619298-122e-48bf-a137-fb876f7c7051","year":1995},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.597601Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:78021f454aeb261dee190bb2566b4cd422580cfffc7725e93afde475187b8cf7","observation_id":"066e2892-ece8-4cea-add0-8edf5d9fab10","resolution":{"observed_at":"2026-08-06T16:45:30.986394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.767439Z","title":null,"venue":null,"work_id":"05aadf0a-6390-463a-9c04-fddb71345fb1","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.758175Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:fb90459c1bb97aa8d22aabf44896c879f2d42637e0b9bbf2342f7a1354804181","observation_id":"1acb98ca-a456-435f-852c-e85608c7820d","resolution":{"observed_at":"2026-08-06T16:45:30.831423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.621764Z","title":null,"venue":null,"work_id":"fd7728c2-e487-49cb-ae9d-31747a686af0","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:17.917994Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:3c6feb58becd4e8046d406b500b2d070905bf03fca93d18b95d151b7d4cd2ebe","observation_id":"562841d6-7fd1-4849-8887-06b33a05202b","resolution":{"observed_at":"2026-08-06T16:45:30.683596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.457170Z","title":null,"venue":null,"work_id":"992b4243-20b0-487e-9739-47675d35d5ca","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.046896Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:d124e5037c276ffa79b321c61cde845ff3863af64881dbdc072109df5ad36a4d","observation_id":"090c0dbc-592c-4645-a8f2-8e1a83d0301e","resolution":{"observed_at":"2026-08-06T16:45:30.512480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-06T08:47:48.830818Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T16:45:18.210032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.210032Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:d349124e35c8a70b125573e1c781285ff36a97c7e32f62fa775a7398132be466","observation_id":"fc0b60dd-6355-4a7b-af04-d789863647da","resolution":{"observed_at":"2026-08-06T16:45:18.210032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-06T16:45:18.339404Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.339404Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:381afe775ddf88da45ecd9e8e2d7ce04700be592828036d99d2978d24b9120d9","observation_id":"bd9c05be-eaa7-46a3-9bfd-7d71c7b84139","resolution":{"observed_at":"2026-08-06T16:45:18.339404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.302667Z","title":null,"venue":null,"work_id":"fe1aee4e-97db-4ce4-8f25-96d828ebac1e","year":2018},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.442216Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:a168aa86b9ac3fe7ad718b3af8a3d525ff916f8c3843e9283973fbbb615ef409","observation_id":"dfd421e6-4d94-401b-889b-5176be923796","resolution":{"observed_at":"2026-08-06T16:45:30.374438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:30.148874Z","title":null,"venue":null,"work_id":"c166b710-888d-49b6-8154-9a7fbaacbb9f","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.555693Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:d59ac4fffdedc1d0b4bc5fd379344652331d9685ef84e92395474f1664e890f9","observation_id":"71a22c9c-29a8-4dd1-a9b2-de44d647a08b","resolution":{"observed_at":"2026-08-06T16:45:30.248872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.989584Z","title":null,"venue":null,"work_id":"dbece49b-b4fb-41d9-af34-6a73036c636c","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.667641Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:163f9765d1e1375998ad11a296d054837cabc313590e83d2e89a88cee0fc8049","observation_id":"3ab6fcf1-1d42-41a3-bff6-202184eb76a3","resolution":{"observed_at":"2026-08-06T16:45:30.053271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.842294Z","title":null,"venue":null,"work_id":"9693c50d-823f-4337-ae75-88f2fa708ba4","year":2018},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.829580Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:42d9903d4336df50027bbabdde2ed8f4b300217e80d50df14085298a06e63431","observation_id":"efe47dd2-d2fa-479c-a643-b6d4f80c138d","resolution":{"observed_at":"2026-08-06T16:45:29.939648Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.657490Z","title":null,"venue":null,"work_id":"dea8f403-9d13-407b-904f-68a371c04d78","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:18.948454Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:739eb21ab0764c910081e415534512e928d9df40382ddb056e418b7d0d34ec25","observation_id":"dcaf465f-bc98-4209-ae98-bb0176cff2dd","resolution":{"observed_at":"2026-08-06T16:45:29.756108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T16:45:19.059261Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.059261Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:62e4d283671f9a3b1073cd9c064cd33865105387dc2abf477bf5be3bb77ac9e0","observation_id":"aa0fbf22-1915-4af8-a734-10a6f04685d2","resolution":{"observed_at":"2026-08-06T16:45:19.059261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.495209Z","title":null,"venue":null,"work_id":"35d4b340-c9fb-41fb-a987-2b3c0559a947","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.125318Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6181bf78cc14c8bd4259f24c1fbae85b2f3317796c386bdff7e04f5e97963655","observation_id":"1c9d1f3a-c026-4267-8dcf-5baab768ca28","resolution":{"observed_at":"2026-08-06T16:45:29.577752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.367615Z","title":null,"venue":null,"work_id":"78ba7014-8f98-4432-936c-39dc88e12776","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.191378Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:9b61fec87ee0e4129ed3f6f015f95254316911267c8bd6d442d9c196d8ef9cdb","observation_id":"b22e5b48-3f1d-4ee5-9306-74b105e135ee","resolution":{"observed_at":"2026-08-06T16:45:29.440462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:19.252146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.252146Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e1e98019ce075474ff19f3e178059f1ae0fda4875fd3d41ba605214b2a005ddb","observation_id":"3bc864f4-bbd2-4213-8abe-0763394b569a","resolution":{"observed_at":"2026-08-06T16:45:19.252146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.226162Z","title":null,"venue":null,"work_id":"39c1981a-f7f8-45f0-9101-50a64ab39de8","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.316279Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:5856a1ad257f7259ce953d163df76faf2518753bb5c38eff64c77531932210c2","observation_id":"b132d912-109d-4d4e-ad00-262a3f50ad19","resolution":{"observed_at":"2026-08-06T16:45:29.303415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:19.380319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.380319Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b453337e15537d7c77ba187019f971e873801f8317951952058f80812706cf3a","observation_id":"d1be0de6-e45a-4b6e-93c8-e949f797ba95","resolution":{"observed_at":"2026-08-06T16:45:19.380319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:19.484626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.484626Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:906e2bf39f62539ca3ad8434bd9ad5b740af9275441a2069e05cf24958ea949d","observation_id":"f4284025-4208-4ba3-860d-22d7ce80f387","resolution":{"observed_at":"2026-08-06T16:45:19.484626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:29.032791Z","title":null,"venue":null,"work_id":"c7c02a0c-5850-43fa-8ac3-6b69bd888335","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.582354Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:9bfadcb15a9a5cd935fd1d153e473631210b8abf61d788728dad65832aa1ac2a","observation_id":"67b3f8db-771c-45f5-8a2c-ed85d5306eb9","resolution":{"observed_at":"2026-08-06T16:45:29.111064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.921741Z","title":null,"venue":null,"work_id":"f84056c1-0150-4dd8-b567-165155c69aee","year":1999},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.654849Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:696476299e4ecbe0ff10af0d92a2411e2be6667ae75e47276e3df53550886bd3","observation_id":"903c5778-321a-4b6a-9990-71477bca37d7","resolution":{"observed_at":"2026-08-06T16:45:28.977218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.750499Z","title":null,"venue":null,"work_id":"0c651642-7b18-4d77-b49c-e4951b2ec109","year":2011},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.706052Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:f27e2239a9db1f670dea1a519b10b47cd417a0b37bf6415037d2c6bfbb8affbf","observation_id":"b1fcfe1f-c8a3-46e0-88f5-54d3be8cfb92","resolution":{"observed_at":"2026-08-06T16:45:28.825248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.624332Z","title":null,"venue":null,"work_id":"b515463f-3d5c-41e1-adc7-f7d4b13a9d94","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.766681Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:eb94b7e48aab9ae94811b281005dfbb6c3727eec5014ad1cde7f0d37b83b9c14","observation_id":"421ad23a-828c-42e1-84ff-7d14c0e04b35","resolution":{"observed_at":"2026-08-06T16:45:28.689472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.456188Z","title":null,"venue":null,"work_id":"0b947f6c-b4d1-4d99-aef3-842dd5901710","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.826604Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:af52a4d5967fc49899178b86e7c67a3d20b6a8c6e75f6b21cd91e0d1ab7705b9","observation_id":"cb8bee88-cded-4d60-b2ef-80001ab964c0","resolution":{"observed_at":"2026-08-06T16:45:28.553173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.328203Z","title":null,"venue":null,"work_id":"9d0c02f5-13e1-45d2-987f-bfca0643bef8","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:19.970555Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:5a2f709ab4e3efe517a581e0a4102df236aa8fcd7855d4c11a8450d615b091a9","observation_id":"0bc2cbd8-b484-4bd4-9578-f1c8abcca316","resolution":{"observed_at":"2026-08-06T16:45:28.381221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:20.151972Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.151972Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e415bc92984082e42f873a62cdb94c832a1ffa8fcb330b22d5f235969f851350","observation_id":"3825d085-e821-44c3-bbef-26ad8bde2bc1","resolution":{"observed_at":"2026-08-06T16:45:20.151972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.968405Z","title":null,"venue":null,"work_id":"221f3f6f-024b-423b-9ab3-024a28ba8744","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.236584Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:217aedd4029866410ddd5603d4e762593743915b741a80b21142554a0d840997","observation_id":"67bc1af9-3e9e-487c-aef1-97747b9135d0","resolution":{"observed_at":"2026-08-06T16:45:28.091116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.689327Z","title":null,"venue":null,"work_id":"0e5e075b-7173-4e9f-8f30-e56d8801a554","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.315156Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:5362d8c187603ab94e9ae4c56b85bc14f9083aecb6a90c302efa006012055ef8","observation_id":"b4c2b2cf-9e86-4afd-b2f5-62ab51ae2448","resolution":{"observed_at":"2026-08-06T16:45:27.812568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.477757Z","title":null,"venue":null,"work_id":"b025aebb-5204-46b4-88b1-85cd0e2675bd","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.389627Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:4576e9e01f168923b04055ff5989c7e4700d963c34ccc3420e03184cd408bb65","observation_id":"3ab811ba-29c0-43f2-8dcd-de372c7dd98c","resolution":{"observed_at":"2026-08-06T16:45:27.551046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:27.192848Z","title":null,"venue":null,"work_id":"985d059e-8db9-445b-95af-d66643240d9e","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.462200Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:1bf7f3d1fc50d1fe5f71e3ff9e48ff855601d27036254a1aad34be4e6ebb0371","observation_id":"fa89783d-1fd1-4d83-bb60-d0bb0eb725fd","resolution":{"observed_at":"2026-08-06T16:45:27.310408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.938408Z","title":null,"venue":null,"work_id":"a55af18e-d09d-42bf-9b46-f4c47dd4fb48","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.551339Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:60c66f9fc7b63460689be459f95dbfeecac3db3593de9fd6cabeabae5ebca9a0","observation_id":"0bbf035d-3d6b-46a5-b355-7f0093fa9515","resolution":{"observed_at":"2026-08-06T16:45:27.031507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.695306Z","title":null,"venue":null,"work_id":"40577e0e-596e-449d-b716-5bc0eeb38c0e","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.608888Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:21635c8d64d0b4e13a3b63f752dc5b52a2e1a4baa1039bdbcd95051595fba163","observation_id":"ab70056c-74b3-4771-b5e0-41e0ab1a23af","resolution":{"observed_at":"2026-08-06T16:45:26.816257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.409357Z","title":null,"venue":null,"work_id":"1e9eaaa1-483d-4dd0-ab9d-5fc21068114c","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.669773Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:b3bf51b6a1d5a59d192308e0fad1cb0b18de7e7593ab2b83875d145153e81fff","observation_id":"999ec2fc-96af-454f-b183-9446912f508c","resolution":{"observed_at":"2026-08-06T16:45:26.558919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:26.141573Z","title":null,"venue":null,"work_id":"fe59edf0-ea45-4e60-8eea-83b6eaf0bf0c","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.739745Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:793a05f9cf0e8fec466253f264984271865bb08c1e0faf19a1c754d61f899827","observation_id":"ee0e4d5c-e92f-49c3-8fe6-22bc3f25eec1","resolution":{"observed_at":"2026-08-06T16:45:26.294311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.822881Z","title":null,"venue":null,"work_id":"de4c7d61-3d81-4a0b-b942-3927a53dee6e","year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.799778Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:aa1e8f70e5a87eb55fccadd00e1c65ac78738cb5e6e61c629808f84e0d604e99","observation_id":"c8d1f276-513c-41b5-a981-3f54fbfed5be","resolution":{"observed_at":"2026-08-06T16:45:25.991752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T16:45:20.869994Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.869994Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6d74220e96101e0f0157df5efc0053d17702b018e219e289fd89addbcb5cc641","observation_id":"18185502-ec8a-4315-abcd-b50fea463acc","resolution":{"observed_at":"2026-08-06T16:45:20.869994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.558685Z","title":null,"venue":null,"work_id":"72965c66-b012-4ce6-8ab4-3cdaa7be7af5","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.922932Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:70d3ad60977b493475563f92db35ab0bb2d122822cd573dd72918cf903cfc13e","observation_id":"20977e04-1194-4894-ac6c-2c707cba5bf0","resolution":{"observed_at":"2026-08-06T16:45:25.632606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.274311Z","title":null,"venue":null,"work_id":"994453ac-b9b3-4907-9a10-5b2653ca445e","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.992599Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e5f977e55bf4bdb64f5e24d77bc4a19aee168bf9d0d0b1ab6937a073b6432978","observation_id":"d206b60e-78b7-45aa-a9c7-c3dd508bb03b","resolution":{"observed_at":"2026-08-06T16:45:25.444651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:25.026913Z","title":null,"venue":null,"work_id":"5af38484-94d8-4b7d-852b-f7aa4956580c","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.059065Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:f371ccec8f5a1461c88eeb16ed3bbdf7bb2005e32d61bd8e2c06cea00c21aab8","observation_id":"a742505e-bbed-4fb8-9b0c-9e42e7b5b6b2","resolution":{"observed_at":"2026-08-06T16:45:25.135740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04458","last_updated":"2024-07-05T12:09:33Z","snapshot_observed_at":"2026-08-02T06:29:22.518474Z","submitted_at":"2024-07-05T12:09:33Z","title":"Robust Multimodal Learning via Representation Decoupling","version":1},"cited_work":{"arxiv_id":"2407.04458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04458","snapshot_observed_at":"2026-08-06T16:45:22.353824Z","title":"Robust Multimodal Learning via Representation Decoupling","venue":"cs.CV","work_id":"4dcdeca2-11e8-4e3d-9d56-a1f4f7e3d0f4","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.160113Z"},"links":{"cited_paper":"/paper/2407.04458","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:c3b69708c949417820d9418629afdec62af04278d638f0ff395ea9ba7bb4c133","observation_id":"16fed420-6fc8-4b77-85c8-46e4f6c3bc92","resolution":{"observed_at":"2026-08-06T16:45:22.401236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.817899Z","title":null,"venue":null,"work_id":"2f51de2a-6f89-435f-9797-d97cd0605cae","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.225510Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:fe10fff755052dd06d098f493e1ba5f0f48054d906ccfada03f3f2ef95001309","observation_id":"e4532737-1946-44f9-b2ff-438b1060446c","resolution":{"observed_at":"2026-08-06T16:45:24.899130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.558495Z","title":null,"venue":null,"work_id":"9c085b9d-d117-4017-a493-fb45cd0d0f69","year":2020},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.258984Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:66af58b13465e0f4b2953d2e23a65f83f2d7d556bb712f999c8c05b06d367f92","observation_id":"5bd510d4-0a23-4193-aed4-f93d164ab97d","resolution":{"observed_at":"2026-08-06T16:45:24.708235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.308499Z","title":null,"venue":null,"work_id":"96791ad9-231e-4754-b6de-655520d6f79e","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.315009Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:992c7ac1011b1ac33aedd9757c79933cbe89b2871b620fc13fd6a2690599bed2","observation_id":"441a7ceb-574a-4099-ac00-884656eaf06d","resolution":{"observed_at":"2026-08-06T16:45:24.416367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-06T16:45:21.383374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.383374Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:456753dcf101e180cf38b5caf98f9aaf3e933ed502fb74d96ce5f684aed12aa4","observation_id":"d8b4ee8e-ad7c-4a73-bbc2-6a7c255d168d","resolution":{"observed_at":"2026-08-06T16:45:21.383374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:24.066412Z","title":null,"venue":null,"work_id":"f569ef6c-2ca3-42bd-83dd-e724658d3249","year":2016},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.416957Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:e9349852b6e8f7b27afdb6d0f22e2648a6737237c562c5b405da45c3eea37b34","observation_id":"f1f1d78f-5a43-44e5-8a0b-6f29d66b3e8e","resolution":{"observed_at":"2026-08-06T16:45:24.171130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:21.485558Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.485558Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6f4859df9447d4bee1d5246e28fdb85a72efe37c8e917a5bef8c1f8523ac9e0f","observation_id":"1769171d-d96f-4f9b-8f8c-9e8c99980236","resolution":{"observed_at":"2026-08-06T16:45:21.485558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.820320Z","title":null,"venue":null,"work_id":"3aca624c-2486-46d6-8be0-4eb8a4e3aca3","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.511078Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:6c207114a9b2b1c2b515a7eaa5d9c6b3beefc1a290f7333cc28b0fcc41d95e48","observation_id":"a82ce2a3-83e5-4142-9bd2-fa4f4afbb70c","resolution":{"observed_at":"2026-08-06T16:45:23.960329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:21.606049Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.606049Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:53a5bf5faaf6c3cf612a388ca3514974ef6cdf171a01ce7b65208df0038f3600","observation_id":"2059dc24-67ec-4f3b-a5bb-83e453513350","resolution":{"observed_at":"2026-08-06T16:45:21.606049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.515885Z","title":null,"venue":null,"work_id":"f5c368dc-ee17-4ff7-af92-848529bd6c9b","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.699540Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:a4a2a04cdfcf220a08f4eb66631335bebcac30e1c74656004e1f17404f02e0cd","observation_id":"55042e15-5de5-40ed-a2e2-fdc29a64e057","resolution":{"observed_at":"2026-08-06T16:45:23.667374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.015859Z","title":null,"venue":null,"work_id":"68a48143-cd28-46e4-bfbe-a985939683d8","year":2021},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.952581Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:bdea4be659c9079bb11a32222a862a4ff7214acf5fc16585699397f1bd99a6cf","observation_id":"3a735be3-68cf-453b-baea-4b87f1a383ed","resolution":{"observed_at":"2026-08-06T16:45:23.187822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:22.789664Z","title":null,"venue":null,"work_id":"5efe37cb-d095-4c7d-b024-1f4002ef7d9a","year":2024},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:22.108246Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:f5af5ba1cfd58f3ba5dbe0b0abf70b1e51de0b780766ef2dec4e3d51f7d356df","observation_id":"3ce759fc-f905-4f33-bf28-3808fec2ca31","resolution":{"observed_at":"2026-08-06T16:45:22.894682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:22.602412Z","title":null,"venue":null,"work_id":"95ed2183-e326-4dd1-86b5-baa8b1733f22","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:22.211214Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:4bfefb27f3e5ca4641a01ca3fff94181d120e440cbd16835d2c257e42945ac3e","observation_id":"41a12ddf-b7db-4e14-b365-e90ece3c2daf","resolution":{"observed_at":"2026-08-06T16:45:22.696752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:16.040975Z","title":"Advances in neural information processing systems 35 (2022), 23716–23736","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:16.040975Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:4ffacf187585f6729e1468ddce1e890d6864470d03612e2780f61238fb8e161a","observation_id":"72aaaf21-c7a1-4f50-a317-44d8ad4c78a0","resolution":{"observed_at":"2026-08-06T16:45:16.040975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:23.321189Z","title":"Remote Sensing 15, 15 (2023), 3871","venue":null,"work_id":"999eb7b7-aaf6-43a6-9c2c-61235aa1019d","year":2023},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:21.815737Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:57755c88745cb8f4a2c4823e64ad4fe9111b58f6d82f66d48a43f833df556a0b","observation_id":"d511d5a4-cfda-48fc-bd27-5871c092fbd5","resolution":{"observed_at":"2026-08-06T16:45:23.432486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:28.171820Z","title":"In Proceedings of the AAAI Conference on Artificial Intelligence, Vol","venue":null,"work_id":"2efc8341-cf4e-4103-97ee-2ccf747e6602","year":null},"citing_paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:20.061931Z"},"links":{"citing_paper":"/paper/2507.12795"},"observation_digest":"sha256:fcc4d30f3f05c9e368cdf6176250e531b2b7d587c6bd56d41852b3df1d42f4ce","observation_id":"3abea8d3-3090-4adb-b5c2-649c3fc5e8ce","resolution":{"observed_at":"2026-08-06T16:45:28.241590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12795","last_updated":"2025-07-17T05:21:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:35:59.799829Z","submitted_at":"2025-07-17T05:21:21Z","title":"City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2507.12795."}