{"as_of":"2026-08-17T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae5321e39c6ff2163ec946d9300dedca5a19c41164b2260dba120a66ddab7211","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:42:44.346158Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:15:52.844188Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T11:13:02.891653Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"cited_work":{"arxiv_id":"2412.19406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19406","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mllm-sul: Multimodal large language model for semantic scene understanding and localization in traffic scenarios","venue":null,"work_id":"9bf2f8e1-7931-40cf-9aed-7e15f28e4f5e","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-08-11T14:54:27.718296Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2412.19406","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:16b1d8ae406196c42532c42860bbcd4a67cf38aa1e1d5cec13630deb01344605","observation_id":"14ee273e-135e-47aa-9a9f-7a009c3d6e88","resolution":{"observed_at":"2026-05-19T11:13:02.893274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19406","snapshot_observed_at":"2026-08-06T19:15:52.844188Z","title":"Mllm-sul: Mul- timodal large language model for semantic scene under- standing and localization in traffic scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06072","last_updated":"2025-07-08T15:14:53Z","snapshot_observed_at":"2026-08-14T00:16:16.256077Z","submitted_at":"2025-07-08T15:14:53Z","title":"MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:52.844188Z"},"links":{"cited_paper":"/paper/2412.19406","citing_paper":"/paper/2507.06072"},"observation_digest":"sha256:064e7ce6b91f8f54aceb03ce630192657222d29dd1729a5a9cd73c645cd3b09a","observation_id":"75cccf7c-c386-4424-b487-f15c47ba9a51","resolution":{"observed_at":"2026-08-06T19:15:52.844188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19406/citation-record","integrity":"/paper/2412.19406/integrity","json":"/paper/2412.19406/citation-record.json","paper":"/paper/2412.19406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:45.098640Z","title":"Traffic sign interpretation via natural language description,","venue":null,"work_id":"cd4c384c-634a-4bcc-8105-d64d32414688","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.143058Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:00fa6c65edf9c0ec97ec8bd242f850670ebd7a6e9525ce2db0c433d79a4dd3a7","observation_id":"87c0b55f-b40d-4b62-8e3f-8a007d717d1f","resolution":{"observed_at":"2026-08-11T00:42:45.104195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19221","last_updated":"2024-04-30T02:48:20Z","snapshot_observed_at":"2026-08-16T13:56:45.594423Z","submitted_at":"2024-04-30T02:48:20Z","title":"Transcrib3D: 3D Referring Expression Resolution through Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.19221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.19221","snapshot_observed_at":"2026-08-11T00:42:44.725917Z","title":"Transcrib3D: 3D Referring Expression Resolution through Large Language Models","venue":"cs.CV","work_id":"474dd6bf-2c56-4071-a8b4-a7a188648c75","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.148383Z"},"links":{"cited_paper":"/paper/2404.19221","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:e38d8f0bef8b6060a1ba5e3a30bf35214baacb16d7074ecf3b08d94baff7c4c6","observation_id":"e6711e8b-336b-4441-ac12-aca8caee8ad9","resolution":{"observed_at":"2026-08-11T00:42:44.731141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11057","last_updated":"2024-07-30T02:35:52Z","snapshot_observed_at":"2026-08-16T14:09:08.831331Z","submitted_at":"2024-03-17T02:06:49Z","title":"Large Language Models Powered Context-aware Motion Prediction in Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11057","snapshot_observed_at":"2026-08-11T00:42:44.154073Z","title":"Large language models powered context-aware motion prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.154073Z"},"links":{"cited_paper":"/paper/2403.11057","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:7cacc9764ef2945796f0c89112dcc3c4b054414956b7e84f8e32d2154a4b0ad1","observation_id":"8f18536d-d3bf-49be-b7fa-2f57fbce27ea","resolution":{"observed_at":"2026-08-11T00:42:44.154073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:45.081391Z","title":"Rlingua: Improving reinforcement learning sample efficiency in robotic manipulations with large language models,","venue":null,"work_id":"2e9f0bd7-1825-4284-b61c-9aac177a8d93","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.159597Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:f910730f2e68a9a29f458bccb89ad52573d6e3f73da24d0aa4dd8c9cfd53506c","observation_id":"ff33035c-5fdd-4795-8676-1349756d0fa6","resolution":{"observed_at":"2026-08-11T00:42:45.086704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T00:42:44.165165Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.165165Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:a01f5d7a5a3baa4ed8a2b1596aae7538c527bc2b235d2a2ec29638e536cde627","observation_id":"4cf745ae-1036-4eda-85b0-812ffbaa0170","resolution":{"observed_at":"2026-08-11T00:42:44.165165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T00:42:44.170821Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.170821Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:f0d5cdf10c86a239d9c3601e0bb208c27ec7d905551c1730c526248fb50816e6","observation_id":"7be3f154-15f2-45e0-b790-5e2a06f9fe14","resolution":{"observed_at":"2026-08-11T00:42:44.170821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:45.066164Z","title":"Drive like a human: Rethinking autonomous driving with large language models,","venue":null,"work_id":"2ef9bf73-78c2-4cf4-8f7d-1c0a264da31d","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.176903Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:265f1b2e4a66d812b292608d12fc21f25f9992a94c6b5a615c0a367dac312190","observation_id":"014d3312-670b-4b8f-bf0a-2f4624944513","resolution":{"observed_at":"2026-08-11T00:42:45.071072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:45.050744Z","title":"Trafficgpt: Viewing, processing and interacting with traffic foundation models,","venue":null,"work_id":"9b561e54-eb28-453b-94d3-c4490469037f","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.181581Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:0abe5a1416f707d8016385f308553fa19b10b35cbf728c060be9393853fc0775","observation_id":"029cb633-85fa-4179-8147-3a39251a4529","resolution":{"observed_at":"2026-08-11T00:42:45.055856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-16T10:28:44.439043Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-11T00:42:44.186156Z","title":"Emma: End-to-end multimodal model for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.186156Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:ac5a6f9e42518b186da0c66c98a6bfadc3deedc0a19a4f9fbd2eed55049343be","observation_id":"41efa04d-4b54-4b72-90e6-cfd3171a36da","resolution":{"observed_at":"2026-08-11T00:42:44.186156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-11T00:42:44.191189Z","title":"Drivevlm: The convergence of au- tonomous driving and large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.191189Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:e62656b0730423681162b8053109fc6ecaf10d818bfd12b4e45da684f3f87a8d","observation_id":"293799c0-70cc-4cb8-bb7a-7cdd9a0f7b76","resolution":{"observed_at":"2026-08-11T00:42:44.191189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08561","last_updated":"2024-04-23T19:19:35Z","snapshot_observed_at":"2026-08-16T14:01:23.010398Z","submitted_at":"2024-04-12T16:00:03Z","title":"IDD-X: A Multi-View Dataset for Ego-relative Important Object Localization and Explanation in Dense and Unstructured Traffic","version":2},"cited_work":{"arxiv_id":"2404.08561","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.08561","snapshot_observed_at":"2026-08-11T00:42:44.632994Z","title":"IDD-X: A Multi-View Dataset for Ego-relative Important Object Localization and Explanation in Dense and Unstructured Traffic","venue":"cs.CV","work_id":"70e9fa3c-a418-4dda-943f-7d9480b908dc","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.196127Z"},"links":{"cited_paper":"/paper/2404.08561","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:9a3e3b3a957a792a02e4b3055a8a99412015929b521d03d917b17b7f7e1d5461","observation_id":"06bc1c7a-60c4-4779-8cb7-51ac5d3d867a","resolution":{"observed_at":"2026-08-11T00:42:44.637871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:45.035573Z","title":"Rank2tell: A multimodal driving dataset for joint importance ranking and reasoning,","venue":null,"work_id":"488d41d8-fca6-4cec-b786-e2b9ecfdde4a","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.201247Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:8c1bf2b7c562d86295d5aa286653c0b4fcf1d095e1c9a249fc60c9363b2a66d4","observation_id":"4a4f0d62-5085-467e-9e39-741b8095069f","resolution":{"observed_at":"2026-08-11T00:42:45.040505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:45.020341Z","title":"Drama: Joint risk localization and captioning in driving,","venue":null,"work_id":"6e68e4cf-1b3c-45fd-96a9-1fdd6d9cca50","year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.205636Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:0469daf5875e87ae7a192837bc756362f4e5fc567c2c444e02b6cfecc6c0dea3","observation_id":"fce9ec8e-7fbf-4051-a382-fc628571f259","resolution":{"observed_at":"2026-08-11T00:42:45.025211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T00:42:44.210191Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.210191Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:7afc174d366a311244d6bdacf64d2b6e485cf22a69ffbc41c335108242c7db3a","observation_id":"e42e428e-9a98-44b8-af07-48b9f5ae7d38","resolution":{"observed_at":"2026-08-11T00:42:44.210191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.215475Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.215475Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:23c743b3a6da89a6377c2d613eb9cb17029b56ffe19e97ecf5675d2bc708307c","observation_id":"7bca6ded-722b-4fb3-a332-78bbb5938f42","resolution":{"observed_at":"2026-08-11T00:42:44.215475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-11T00:42:44.220696Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.220696Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:4cbe0251ae18fc6a8a8e609e6eee423c37aa223079a74637c6c6176b846b43d3","observation_id":"6aad559a-12cf-4186-a68f-b45a408e7178","resolution":{"observed_at":"2026-08-11T00:42:44.220696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.994417Z","title":"A hybrid cnn-lstm approach for image caption generation,","venue":null,"work_id":"e707a886-3209-41f0-bdbe-8d221bc1efbb","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.226296Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:0c3d8e855262f7c06791cf48337a67fea29472bd8f45c06f0a4018548dcfd48a","observation_id":"429c9b32-8a8f-4f05-939c-d7e54e0d693b","resolution":{"observed_at":"2026-08-11T00:42:44.999001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.979875Z","title":"Improving pre-trained cnn-lstm models for image captioning with hyper-parameter optimization,","venue":null,"work_id":"e16bacb9-ef35-47b1-abca-381d6bb4201e","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.231820Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:b331e207b770aa8fd8eaed5406d594473411c9e0d8015e2c637ab2125f65de5a","observation_id":"29f315b2-b4f3-47dd-b46b-ab66ce1b7520","resolution":{"observed_at":"2026-08-11T00:42:44.984581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.965657Z","title":"Benet: bi-directional enhanced network for image captioning,","venue":null,"work_id":"d5f01b29-6081-4f80-8834-60c58eb3038a","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.237336Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:d60db4400948603163c24c31398428f10b9d5914cd5d4db10a341d6a9cafbc7c","observation_id":"f2371168-6553-4872-85e2-e634d7785124","resolution":{"observed_at":"2026-08-11T00:42:44.970286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.951723Z","title":"Regular constrained multi- modal fusion for image captioning,","venue":null,"work_id":"beaed114-7ed3-461e-a439-b4d7afeb3782","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.242072Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:2d10a47cbe7320c7b8e869dd641174ce52331e38992135c3b20a7746a4e0a71c","observation_id":"49245009-b56e-4ab6-8525-46a9d9d14be6","resolution":{"observed_at":"2026-08-11T00:42:44.956207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.936522Z","title":"A dual-feature-based adaptive shared transformer network for image captioning,","venue":null,"work_id":"2b427c82-41b3-4eb8-98dd-6ecd942bc5d2","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.246567Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:10b1e3b7af5ab6455c07a78cecdeb995693d4b5114d315f38b9e8923bb0c9490","observation_id":"8d2a82f4-8da4-43ed-81d2-a8d1c1f07106","resolution":{"observed_at":"2026-08-11T00:42:44.941678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.920680Z","title":"Dual-adaptive interactive transformer with textual and visual context for image captioning,","venue":null,"work_id":"bb824d19-d1b6-42f8-954e-bc9036f5488d","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.250928Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:b81d8a6c1f96390c405780c520b2659773237e2a1aa968cd67c82c7ba8fe9d91","observation_id":"3bea342d-20f6-4e7c-af8e-c01205514a6f","resolution":{"observed_at":"2026-08-11T00:42:44.925408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.906427Z","title":"Visual instruction tuning,","venue":null,"work_id":"338f5123-9003-49e0-b8c0-d09e6ea4f742","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.255358Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:506cecc16aed8dad33a6c738e32d351c4eb60654949f3e3086259f5f7ad0a243","observation_id":"2b6b9a87-47c4-4cb7-9307-c8d73441dbf8","resolution":{"observed_at":"2026-08-11T00:42:44.910910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T00:42:44.259899Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.259899Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:9503147baf3edd57b91dd2d3522be6a6610b041883101e6e21a04aa3ef9b50d0","observation_id":"b99e2775-e418-488e-9782-f5f7355c7736","resolution":{"observed_at":"2026-08-11T00:42:44.259899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11403","last_updated":"2023-10-27T16:38:40Z","snapshot_observed_at":"2026-08-16T15:46:45.180866Z","submitted_at":"2023-03-20T19:20:34Z","title":"eP-ALM: Efficient Perceptual Augmentation of Language Models","version":4},"cited_work":{"arxiv_id":"2303.11403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.11403","snapshot_observed_at":"2026-08-11T00:42:44.565571Z","title":"eP-ALM: Efficient Perceptual Augmentation of Language Models","venue":"cs.CV","work_id":"b65b51af-0035-4c00-ae47-f94dc59cf249","year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.264746Z"},"links":{"cited_paper":"/paper/2303.11403","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:7b44789690d3d5e8a15287b8bb7c13b6d58aeb128fb49611696f476bee4dd5da","observation_id":"6b280f1a-f7ee-4211-8a88-65c6165f75af","resolution":{"observed_at":"2026-08-11T00:42:44.572557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.891602Z","title":"Vlaad: Vision and language assistant for autonomous driving,","venue":null,"work_id":"6f0061f4-685c-43ae-a150-483a043dec72","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.269806Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:378741de2662bd9866bce81e8cdc39e60ec276c1c697f9da20b9cfb40c8b5753","observation_id":"fefbb950-5ba8-4c67-b5cc-67237a7d2e80","resolution":{"observed_at":"2026-08-11T00:42:44.896740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.876753Z","title":"Dolphins: Multimodal language model for driving,","venue":null,"work_id":"bad43086-3048-47be-b81f-23e1b6a1f935","year":2025},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.274317Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:7ac3cf80ac1bc68e89acfd6f0ec4bcf647473e6c72a3ff8f0f69e182e9f768ea","observation_id":"645adf7e-4c5c-4b01-bc9e-f59824a70e34","resolution":{"observed_at":"2026-08-11T00:42:44.881778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.860035Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":"7fbd3cbf-98e0-4aad-9341-cdac21c47e83","year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.279054Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:c1095e2652275ba124add31ab704d7a6ebb647a7cc2708856ead13cb4d232c77","observation_id":"2ec9fcc0-44ed-4f91-bd7e-a78245fe51dc","resolution":{"observed_at":"2026-08-11T00:42:44.865695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00988","last_updated":"2024-01-02T01:54:22Z","snapshot_observed_at":"2026-08-17T05:45:27.991254Z","submitted_at":"2024-01-02T01:54:22Z","title":"Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00988","snapshot_observed_at":"2026-08-11T00:42:44.283698Z","title":"Holistic autonomous driving understanding by bird’s-eye-view injected multi- modal large models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.283698Z"},"links":{"cited_paper":"/paper/2401.00988","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:cc0d86eb45ac31af8bd6c2a2bedbe6704bb416ff72ec41dcf708e0a9f50ce429","observation_id":"060ea510-2359-4eac-bbf6-b29869458082","resolution":{"observed_at":"2026-08-11T00:42:44.283698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.288850Z","title":"Rag-driver: Generalisable driving explanations with retrieval-augmented in-context learning in multi-modal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.288850Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:f3341d04eef6f78f5a11c49048f54c7156ca636cff111232ad9951a57430e133","observation_id":"49be8927-e62b-4a1c-bd5d-947d15130ca9","resolution":{"observed_at":"2026-08-11T00:42:44.288850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05186","last_updated":"2025-03-24T07:07:59Z","snapshot_observed_at":"2026-08-16T15:01:51.775546Z","submitted_at":"2023-09-11T01:24:13Z","title":"HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05186","snapshot_observed_at":"2026-08-11T00:42:44.293660Z","title":"Hilm-d: Towards high-resolution understanding in multimodal large language models for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.293660Z"},"links":{"cited_paper":"/paper/2309.05186","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:cfafc26c39747cbf37c1a63c9d4097b4450a9d71e0d5ce514bdac4f4bb398ae9","observation_id":"2ee5c6f2-2ec7-4ffd-8f8f-90ff05d76dc3","resolution":{"observed_at":"2026-08-11T00:42:44.293660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.298567Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.298567Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:139a68d699554bdf4a73789941ed3a12b3b5289ade16bdfe5088483b3dd06bc5","observation_id":"ec1e870d-a8d1-4e66-bb84-cd6cef2588ae","resolution":{"observed_at":"2026-08-11T00:42:44.298567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.834984Z","title":"Faster r-cnn: Towards real- time object detection with region proposal networks,","venue":null,"work_id":"6c11d607-4615-4662-920c-c9fe9b7d1358","year":2015},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.303123Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:cb01578960b27a5df72f430faa690335bbbf2d07fc8233bbd9c64dbb82b6b157","observation_id":"124f003b-3f36-4157-8831-2915137583bc","resolution":{"observed_at":"2026-08-11T00:42:44.839808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T00:42:44.307520Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.307520Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:d7e73f47b2d4a45a1f5488d6522f9c02fba8a3f7baacc63e63b685903fa3944c","observation_id":"6463d84b-a642-465a-9215-59d3d326ab2b","resolution":{"observed_at":"2026-08-11T00:42:44.307520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.820386Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"81943a82-acc9-42fd-9253-9eb5de41b2ef","year":2021},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.312055Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:22977f51163c6cdfc9bd2cd102b0983e4cac0ee8a08c112b67f4c5729056687b","observation_id":"d355e3be-536c-4d40-a7fe-1da4164d81a5","resolution":{"observed_at":"2026-08-11T00:42:44.825053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-11T00:42:44.317027Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text pro- cessing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.317027Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:62c77f270bdde054575f73ca3fb895e501361b889430fc62c8fe80e248228af2","observation_id":"2d2e1e52-d195-4943-afde-07ab9425001f","resolution":{"observed_at":"2026-08-11T00:42:44.317027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.804208Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression,","venue":null,"work_id":"8609e31a-5c7f-4c99-9240-80445107008e","year":2019},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.322245Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:482dc5fe39ffaca44816faff1a414e982c4cd9a04ef84a37fc1db6d6b5556952","observation_id":"2c52151b-2b49-4d90-8f75-8cafadc65744","resolution":{"observed_at":"2026-08-11T00:42:44.809432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.789214Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"89ec237e-db8a-496e-b925-37ded25b2aee","year":2002},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.326751Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:da0aa2a4fddfd8fb0bc4dd3b82d993e59e532b5ebea4f174d97f0eef973c047e","observation_id":"cbf66b7c-001d-4d95-84a8-d59996592f6d","resolution":{"observed_at":"2026-08-11T00:42:44.794099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.773380Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"ff3350eb-27e6-43b5-b9fc-1dd663391c68","year":2005},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.331519Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:6ce9942f488888be5eaf7f4e03439ba200525dc9f2b0861240c5a38aad5e6f8e","observation_id":"4cc20059-aae8-43cd-b748-352095ae956f","resolution":{"observed_at":"2026-08-11T00:42:44.779090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.757880Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":"0c664738-b394-44bb-93b8-8c20ae7029cf","year":2015},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.336391Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:0a1688b6b1b0453201427bb041f0d141af415c0109b510b3fb32666bd8cf7a98","observation_id":"69c83753-9638-4893-9e35-dd51af1bd1d2","resolution":{"observed_at":"2026-08-11T00:42:44.762900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:42:44.742066Z","title":"Swin transformer v2: Scaling up capacity and resolution,","venue":null,"work_id":"91fa8997-6d16-4c48-bdb6-0c08a4a014ad","year":2022},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.341007Z"},"links":{"citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:6579beb8812602dd9c5e17e338392870e1a4802752fffccfc9b9853a98ef7740","observation_id":"01cc0114-9ffa-4273-a8ca-0730e4cdff10","resolution":{"observed_at":"2026-08-11T00:42:44.747378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T00:42:44.346158Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:42:44.346158Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.19406"},"observation_digest":"sha256:5d625e051c2cea75df8857c52b323e40f371d33a4d7c20e1365bdf48d8b75425","observation_id":"1a2ffc71-991a-466a-bb94-01e9ee4edce7","resolution":{"observed_at":"2026-08-11T00:42:44.346158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19406","last_updated":"2024-12-27T02:05:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:08:01.513061Z","submitted_at":"2024-12-27T02:05:38Z","title":"MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2412.19406."}