{"as_of":"2026-08-15T19:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bd2acfcf98a8586b093e34269974bff075109336c5e22edb2233f52c8fbb0ee","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:30:36.752852Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:02.400451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.962434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04671","snapshot_observed_at":"2026-08-07T14:03:02.400451Z","title":"Drivingvqa: Analyzing visual chain-of-thought reasoning of vision language models in real-world scenarios with driving theory tests,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-14T01:14:39.568702Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:02.400451Z"},"links":{"cited_paper":"/paper/2501.04671","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:f94da181aa0f570609a15fab627b93548a1706ec37cc954a379b5ce79343cb14","observation_id":"9c7da779-1d85-4c52-8184-f79c7db28ea5","resolution":{"observed_at":"2026-08-07T14:03:02.400451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"cited_work":{"arxiv_id":"2501.04671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04671","snapshot_observed_at":"2026-07-03T21:28:58.962434Z","title":"Retrieval-based interleaved visual chain-of-thought in real-world driving scenarios","venue":null,"work_id":"4ee1f56b-eae4-4155-a05c-4c1d334864e1","year":2025},"citing_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T02:35:13.126171Z"},"links":{"cited_paper":"/paper/2501.04671","citing_paper":"/paper/2511.00088"},"observation_digest":"sha256:c03596c69e0220cbe29b44dafd0e0d6a0d38f799dd657eb993321bf03582b14b","observation_id":"20675e45-9e4a-438a-9623-f38d744f27ab","resolution":{"observed_at":"2026-05-18T02:35:13.306854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"cited_work":{"arxiv_id":"2501.04671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04671","snapshot_observed_at":"2026-07-03T21:28:58.962434Z","title":"Retrieval-based interleaved visual chain-of-thought in real-world driving scenarios","venue":null,"work_id":"4ee1f56b-eae4-4155-a05c-4c1d334864e1","year":2025},"citing_paper":{"arxiv_id":"2512.14044","last_updated":"2026-04-30T14:06:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-16T03:19:28Z","title":"OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:00.895252Z"},"links":{"cited_paper":"/paper/2501.04671","citing_paper":"/paper/2512.14044"},"observation_digest":"sha256:140b9dd4137c9ddc390e051a8d183bcd899b2b8e540df1e65a187f3f6e29fac7","observation_id":"f7b6ac57-9991-47a6-a0a8-920044a279fd","resolution":{"observed_at":"2026-05-16T22:38:37.815554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"cited_work":{"arxiv_id":"2501.04671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04671","snapshot_observed_at":"2026-07-03T21:28:58.962434Z","title":"Retrieval-based interleaved visual chain-of-thought in real-world driving scenarios","venue":null,"work_id":"4ee1f56b-eae4-4155-a05c-4c1d334864e1","year":2025},"citing_paper":{"arxiv_id":"2603.27112","last_updated":"2026-04-23T14:57:50Z","snapshot_observed_at":"2026-08-14T10:39:07.836038Z","submitted_at":"2026-03-28T03:41:40Z","title":"RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T22:24:13.897439Z"},"links":{"cited_paper":"/paper/2501.04671","citing_paper":"/paper/2603.27112"},"observation_digest":"sha256:aba8d98edb7e3aee4b86b1f308daa7098509e7b579ef5272fe96d512ef88e078","observation_id":"9e10aa20-2566-4a03-94a5-b7daf20abbb7","resolution":{"observed_at":"2026-05-14T22:28:04.771507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"cited_work":{"arxiv_id":"2501.04671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04671","snapshot_observed_at":"2026-07-03T21:28:58.962434Z","title":"Retrieval-based interleaved visual chain-of-thought in real-world driving scenarios","venue":null,"work_id":"4ee1f56b-eae4-4155-a05c-4c1d334864e1","year":2025},"citing_paper":{"arxiv_id":"2606.01624","last_updated":"2026-06-02T05:32:33Z","snapshot_observed_at":"2026-08-14T10:56:47.843869Z","submitted_at":"2026-06-01T03:18:01Z","title":"What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:36:25.219607Z"},"links":{"cited_paper":"/paper/2501.04671","citing_paper":"/paper/2606.01624"},"observation_digest":"sha256:5db05ed449e1e58d4b0edfaf4e78b17c37991ca1130cd167d5c5a14fe4ab1a02","observation_id":"bec3ebc2-c327-4c0a-97e8-589271f2df65","resolution":{"observed_at":"2026-07-01T22:16:16.242167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"cited_work":{"arxiv_id":"2501.04671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04671","snapshot_observed_at":"2026-07-03T21:28:58.962434Z","title":"Retrieval-based interleaved visual chain-of-thought in real-world driving scenarios","venue":null,"work_id":"4ee1f56b-eae4-4155-a05c-4c1d334864e1","year":2025},"citing_paper":{"arxiv_id":"2606.18385","last_updated":"2026-06-16T18:28:47Z","snapshot_observed_at":"2026-08-10T19:47:09.933455Z","submitted_at":"2026-06-16T18:28:47Z","title":"CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T00:31:01.692743Z"},"links":{"cited_paper":"/paper/2501.04671","citing_paper":"/paper/2606.18385"},"observation_digest":"sha256:df5f62e2242952745a0c0f0aa919efcbbdbbd1a6f6ae87fa1c46ffcc6060e07e","observation_id":"2ae9e646-ecb7-41cd-a9d2-b45ce7697733","resolution":{"observed_at":"2026-07-03T21:28:58.963898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04671/citation-record","integrity":"/paper/2501.04671/integrity","json":"/paper/2501.04671/citation-record.json","paper":"/paper/2501.04671"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:36.149229Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.149229Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:9786d28bedcf1d62dd1dbbb501faec0c83395c260466573de4b128c6a3906dfc","observation_id":"6eac0e54-24dc-4f11-a550-b4dfa5e8b48a","resolution":{"observed_at":"2026-08-10T21:30:36.149229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:39.189167Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"ba1cf11f-33aa-40f2-80e3-d389915e5003","year":2015},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.162752Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:7aaee31c7886b83583ee50a8eb065a09f3b03c80529772a1bf74b91249f4fa1b","observation_id":"2e26796c-e549-427a-a216-75b008ededc2","resolution":{"observed_at":"2026-08-10T21:30:39.197797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06721","last_updated":"2024-08-13T08:26:32Z","snapshot_observed_at":"2026-08-13T01:02:35.814053Z","submitted_at":"2024-08-13T08:26:32Z","title":"Response Wide Shut: Surprising Observations in Basic Vision Language Model Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06721","snapshot_observed_at":"2026-08-10T21:30:36.172684Z","title":"Response wide shut: Surprising observations in ba- sic vision language model capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.172684Z"},"links":{"cited_paper":"/paper/2408.06721","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:8dcc1280074d5851fd149470bcf887c2abb898e78ec15741ad6e83e8a42d5486","observation_id":"d8725a61-6142-439d-8372-47b3fd01cea6","resolution":{"observed_at":"2026-08-10T21:30:36.172684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-10T21:30:36.183356Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.183356Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:fca12e1f6821f93dc7d5364a010f0eeee1802d3a9fa7366a1e159cd5c9699a38","observation_id":"170c53ea-a194-4a52-8804-b90bc786f8a9","resolution":{"observed_at":"2026-08-10T21:30:36.183356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-08-13T00:49:48.506095Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-08-10T21:30:36.202132Z","title":"Puzzlevqa: Diagnosing multimodal reasoning challenges of language models with abstract visual patterns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.202132Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:002c34fa9613a7c0dc95b4a78030e1890ab8274f24a60b6b370230c46e879952","observation_id":"a2bde1ed-0c76-42ea-86fe-afe2792a6806","resolution":{"observed_at":"2026-08-10T21:30:36.202132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:39.152883Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"6123ad3c-16f1-4b72-8a66-02ea032274e5","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.212947Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:6e23aec7d51a15c4775ffd550a24d6c233bd4f0e0bf06866509948438dcc797a","observation_id":"e9b4910e-bd5c-4a08-8208-9d3b0941154b","resolution":{"observed_at":"2026-08-10T21:30:39.167769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:39.121433Z","title":"Making the V in VQA matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":"9c187201-0369-48ff-a036-c0ba59e188db","year":2017},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.223655Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:d9e55c4131aea51735283631ff983c8d5c51dbaeb6fa973c96fc58701ec02299","observation_id":"f619a843-7cc5-4e5b-8946-22802fc1eb0f","resolution":{"observed_at":"2026-08-10T21:30:39.130806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-10T21:30:36.240289Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.240289Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:c7b3f81dd79a60b716213a913dd7b4d055c2ae706d23c7392c0528adb545dff8","observation_id":"1983a855-2c2c-4077-b4d2-5c3557fb5f16","resolution":{"observed_at":"2026-08-10T21:30:36.240289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:39.094535Z","title":"Hal- lusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":"dca0188f-efee-4672-9862-784081a52cd4","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.247879Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:7fb2e6b2d0788c6e5f2d7a97d999c5b81dedd6d3c14951b14d989b196f785841","observation_id":"6debd138-9dad-49e2-b3b7-33b1df524c3e","resolution":{"observed_at":"2026-08-10T21:30:39.103518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:39.056486Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"6b53dc1e-fd0d-4c71-9e98-6d22a8dccaad","year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.255730Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:34423b498c45de38aef64aaff51d9a54114300050f317b87aae92371056dee79","observation_id":"2481ea86-57d9-4fee-ba29-f746ea242c48","resolution":{"observed_at":"2026-08-10T21:30:39.065647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:39.006845Z","title":"Gqa: A new dataset for real-world visual reasoning and composi- tional question answering","venue":null,"work_id":"12196540-504e-4e36-96e3-fe074f117c24","year":2019},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.262399Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:22322487024ae5bba220d4f35d9da57b8ad6f53e09907ef06eca20f8eb6549e3","observation_id":"7545632b-f99b-434d-b33e-617ce985ee69","resolution":{"observed_at":"2026-08-10T21:30:39.017237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-10T21:30:36.269691Z","title":"Emma: End-to-end multimodal model for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.269691Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:fd88e4d49ff37000f3a1573dc129b3ab4a1caea30ed1b709550ffee280ae9200","observation_id":"be5f94ff-42c1-44b5-90b0-58647365c8c8","resolution":{"observed_at":"2026-08-10T21:30:36.269691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.979664Z","title":null,"venue":null,"work_id":"5e18d61f-a71c-4d9c-9b3c-284c5266be77","year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.278634Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:08875f7f55e857d5654b8c1032c7a84a913a720e8777c283f1b10152edafc2ba","observation_id":"1c722649-ff0e-479a-b36d-4a84de4c5db3","resolution":{"observed_at":"2026-08-10T21:30:38.988473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.944718Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":"f59a95db-52e4-4019-bebb-e161a470d8e2","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.288146Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:d8df83601a02dc32879ce8eecc4990d4e8ddd33355952946318b06df29d5969f","observation_id":"a992410b-0699-4e80-bf10-ebca3b119452","resolution":{"observed_at":"2026-08-10T21:30:38.954899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.917782Z","title":"Textual explanations for self-driving vehicles","venue":null,"work_id":"1401288e-f8be-4a7a-a70d-5d988e2c3eec","year":2018},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.296054Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:d886ba1447d2495a9c1ec71d6d949ea423b7081937d8f0355ba5306ff0db55ee","observation_id":"720b1843-4ba2-4ccf-8c86-785e32544d45","resolution":{"observed_at":"2026-08-10T21:30:38.924396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12058","last_updated":"2024-02-19T11:23:53Z","snapshot_observed_at":"2026-08-13T04:15:32.439760Z","submitted_at":"2024-02-19T11:23:53Z","title":"Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12058","snapshot_observed_at":"2026-08-10T21:30:36.312300Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.312300Z"},"links":{"cited_paper":"/paper/2402.12058","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:2571d29396b61247c173ceacdafc4ecd8c2589d9b6b9b1d0388b8173df63ceb4","observation_id":"188272a2-6265-4d64-b66a-783612a9a630","resolution":{"observed_at":"2026-08-10T21:30:36.312300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:30:36.324818Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.324818Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:013c743744b740076f3f7ede77620007c83f4a95f2f3eda9ec844e7b962373db","observation_id":"7bb1aab0-1a22-477b-876e-037b4f056aca","resolution":{"observed_at":"2026-08-10T21:30:36.324818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.877637Z","title":"From representa- tion to reasoning: Towards both evidence and commonsense reasoning for video question-answering","venue":null,"work_id":"49e53882-b344-4944-93cb-3059e5af6009","year":2022},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.335361Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:8b556e563a9e71e978e03496ead039054f738c6a5468017a3bc7dffc66395e34","observation_id":"3be75811-bf98-4772-be0c-09b8a9447a60","resolution":{"observed_at":"2026-08-10T21:30:38.888105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.855763Z","title":"Chain-of-region: Visual language models need details for diagram analysis","venue":null,"work_id":"a43e6117-bcfd-4ee5-9978-8c9259a4b4ca","year":2025},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.343783Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:47101615da106bf95646ed7d7da5b5236e27dba18793eb31c99e2e5eb69a8025","observation_id":"7cbf36dd-cf39-448b-a6b4-9df9eb0d374b","resolution":{"observed_at":"2026-08-10T21:30:38.861322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.823163Z","title":"Enhancing advanced visual reasoning ability of large language models","venue":null,"work_id":"0b1060b0-eaab-4448-b28d-2a37034357ff","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.350843Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:db41775aaa707bae5feddca64e3bbc7aa3eff49d786ff5e4921b02a2c883a423","observation_id":"3accbeb3-2ebb-4ce3-b660-730752a9e7f4","resolution":{"observed_at":"2026-08-10T21:30:38.834923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.793455Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"564c3546-b935-4535-b4f8-34677a50dbb6","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.358581Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:c63090d7a541fbadff6c1474e57e28d79c2c6dce8b98686311d37fef12b8c3a7","observation_id":"1607bf4c-20b8-4e3d-91fd-0c2b3270945f","resolution":{"observed_at":"2026-08-10T21:30:38.800965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:36.365886Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.365886Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a233f0c932cbbbc468be803d58e60d06237ccd72c9ef84206559cd9ec7051a57","observation_id":"ab371db2-69cb-4c8a-9f81-cb3562882ca2","resolution":{"observed_at":"2026-08-10T21:30:36.365886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.737260Z","title":"Visual instruction tuning","venue":null,"work_id":"ca4c7ffc-b20f-48f4-bfdf-46e7d3e6fff3","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.371144Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:d43d21b5933ea4435b972d39d578217e70c09211aa786423ecedd8eae30db1aa","observation_id":"93eee8a4-0a34-466c-840f-62cbf698f9cf","resolution":{"observed_at":"2026-08-10T21:30:38.743639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-13T12:48:26.884823Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-10T21:30:36.377405Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.377405Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:ddd1cb1565cbe3b92d2ba27c123abd5df012c9dc6514617c0d96bfec21572e9c","observation_id":"816f331d-2bf9-433b-8222-4abc381eb137","resolution":{"observed_at":"2026-08-10T21:30:36.377405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T21:30:36.385263Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.385263Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:d1e3796c4adfee9faea0d6bb05220b5c445a076397709711b725ecc3775bb88b","observation_id":"c476e120-ccb2-419d-8774-b1239cbad4c0","resolution":{"observed_at":"2026-08-10T21:30:36.385263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16950","last_updated":"2025-01-17T03:43:53Z","snapshot_observed_at":"2026-08-13T20:44:38.697459Z","submitted_at":"2024-03-25T17:11:28Z","title":"Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16950","snapshot_observed_at":"2026-08-10T21:30:36.390831Z","title":"Aligning with hu- man judgement: The role of pairwise preference in large lan- guage model evaluators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.390831Z"},"links":{"cited_paper":"/paper/2403.16950","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:9298e785cf394437bf279aa7d7059c9e95b472cda65d310552c984dda94f5864","observation_id":"44dc0183-0c48-4173-9e4e-b63d19ed9b6d","resolution":{"observed_at":"2026-08-10T21:30:36.390831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10074","last_updated":"2025-01-23T02:31:25Z","snapshot_observed_at":"2026-08-10T21:32:39.307025Z","submitted_at":"2025-01-17T09:46:27Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10074","snapshot_observed_at":"2026-08-10T21:30:36.398003Z","title":"Spatialcot: Advancing spatial reasoning through coordinate alignment and chain-of-thought for embodied task planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.398003Z"},"links":{"cited_paper":"/paper/2501.10074","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:ce2ea491fb008fe5549aecccc6bfc33818a0638612f51c97fd0be33081df7950","observation_id":"18877e83-5800-48e1-ae17-c318030e4a98","resolution":{"observed_at":"2026-08-10T21:30:36.398003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.709741Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":"5c01abab-058d-4161-b897-b8b4438cd743","year":2025},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.414293Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:d580064366c38253da145026950242437fbeaffd7ff29532f9a7a3afb825434f","observation_id":"3c0eeb34-a7e3-4ab0-b455-8a067e927ebc","resolution":{"observed_at":"2026-08-10T21:30:38.717175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:36.420260Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.420260Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:34aab81e3054c9061626650179eda503a3460d26b36ba20dfab62164fafba6a0","observation_id":"c598d8a0-c409-402c-8336-af120426c895","resolution":{"observed_at":"2026-08-10T21:30:36.420260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.650751Z","title":"Lingoqa: Visual question an- swering for autonomous driving","venue":null,"work_id":"2f95eb3e-c73f-472a-83f9-ea9f3040a116","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.430131Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a068b1a6b99b3e642bec3014fe542c501543b1c45b70ceb00e33bd97ceedda18","observation_id":"a306cbfd-7391-4d0b-a444-94c2384f3c63","resolution":{"observed_at":"2026-08-10T21:30:38.658998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.620358Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"106636f9-16c3-4eae-8fee-734fe1998cb5","year":2019},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.437404Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:2d7bf0a5e4eb28b7023ae823953dc87f469448ac3b520a6e2ddf77f9c0ae0a74","observation_id":"7e0d9d59-297e-4d3a-acc9-8af6ae3c31b9","resolution":{"observed_at":"2026-08-10T21:30:38.628535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.597726Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"fbac9212-9958-4fd4-b5df-edb3e61ea7c2","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.448556Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:681318596501e5678620412ac2fbff358b35a69e93afb7d36ca838cb499d3615","observation_id":"e5d10df3-bf1c-42e5-8782-8b15ee4477ce","resolution":{"observed_at":"2026-08-10T21:30:38.604162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.562402Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"6ab86de7-8e15-4aa5-8e07-aed8967de0a6","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.455451Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:da8a1772b99076f404126e774ad0c48bf5a5ecc9346495c561146f7a0922219f","observation_id":"b5901ceb-6a78-4511-bfbb-ebf7cd7bcf2e","resolution":{"observed_at":"2026-08-10T21:30:38.571257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.527762Z","title":"Openai o1 system card, 2024","venue":null,"work_id":"b99d601a-6805-418b-8c65-0db20e51835e","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.461161Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:6b6aad469c59df061181f545eb5133ad60751e1bbacb358bbf743a8ffdb73e84","observation_id":"2cdf85ba-8a17-45f4-a2ed-e9b400298c5a","resolution":{"observed_at":"2026-08-10T21:30:38.536737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.486410Z","title":"Enhancing visual question answering through question-driven image captions as prompts","venue":null,"work_id":"e4d8181f-68b8-4cbd-bfa4-2789f4413798","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.466714Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:930608d18449780ccbf11fab865385fd85afc5a482992623b36d65beefa6e214","observation_id":"315e8c15-ac7a-4028-aea9-04a7aaa22793","resolution":{"observed_at":"2026-08-10T21:30:38.496766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.450560Z","title":"Piaget’s theory of intelligence","venue":null,"work_id":"c9589319-b156-41ec-9b78-3fc1ccb28d14","year":1978},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.472476Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:f56c31b25783d4244332baff38fdcb2324016cf4d59901e56793f17b6ab708b1","observation_id":"ab18df49-45f2-4dd3-b3a7-a91f34b91cc5","resolution":{"observed_at":"2026-08-10T21:30:38.459157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-13T04:24:55.131656Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-10T21:30:36.478381Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.478381Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:debee164a57fb8bb48dd07fae3bd165c8058feea4c1a0103dd36c3a048f76435","observation_id":"cbbb9c9f-49d9-4292-95c3-dbc310f9ad4d","resolution":{"observed_at":"2026-08-10T21:30:36.478381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.422675Z","title":"Nuscenes-qa: A multi-modal visual ques- tion answering benchmark for autonomous driving scenario,","venue":null,"work_id":"23d022d5-46f0-471b-bd5c-520b47af4864","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.485056Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:9022b939c9cedc316e98f484d39b1f87c72898e9ce0449e7712648486784047e","observation_id":"afd6f303-18b7-408f-b4ec-c257d5eab6d8","resolution":{"observed_at":"2026-08-10T21:30:38.435527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.379522Z","title":"Prism: A framework for decoupling and assessing the capabilities of vlms","venue":null,"work_id":"5899c212-064d-498e-9cb0-87a7e499f610","year":2025},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.491409Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:2e114e1e32986d8de88580a017706bef1c4970172fca2ed4bc118b5f4ab78d06","observation_id":"e49f37cf-2b07-4896-aaa2-02cc98e11da3","resolution":{"observed_at":"2026-08-10T21:30:38.393214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.359113Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"e5f50e29-da2c-4851-86f7-d4c93f41563c","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.497058Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:53259c0a881377e8f93d032f73a8be50b4d182655444f67975455b38660abc50","observation_id":"93b07525-29fd-4455-a296-13be0a3f35d3","resolution":{"observed_at":"2026-08-10T21:30:38.365510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-08-13T09:28:56.389286Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-10T21:30:36.506782Z","title":"Visual cot: Advancing multi-modal language models with a comprehen- sive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.506782Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:fcc44ca6ab8ba6524c02dcbc5e3e6feec89cbb7d0cfa2a1bc3be50d09c0ad985","observation_id":"4e7aab82-e0b8-4f80-9015-05064d369046","resolution":{"observed_at":"2026-08-10T21:30:36.506782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.330976Z","title":"Drivelm: Driving with graph visual ques- tion answering","venue":null,"work_id":"caf57793-e63d-4b57-be8a-d0ffb59736a3","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.514338Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a56ef514ab553733b446e06c105d33e5f807b181ab826a77f0711d3524f62aaa","observation_id":"90af283d-834c-48a2-a291-677c09ccb2a9","resolution":{"observed_at":"2026-08-10T21:30:38.336952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.308821Z","title":"Towards vqa models that can read","venue":null,"work_id":"6506c146-a44d-4783-9ca5-c8f883555128","year":2019},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.522235Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:c7ce6feb9b70bfc06dbd6aeb5ecb9b899e067ff6976a3cc2b874d8d51bbecc26","observation_id":"7f0ea722-c5fd-4956-939f-032f56899a7d","resolution":{"observed_at":"2026-08-10T21:30:38.314568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-12T22:42:16.155601Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-10T21:30:36.527626Z","title":"To cot or not to cot? chain-of-thought helps mainly on math and sym- bolic reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.527626Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a7b43d242c861ee86f49fd589d4319080b3b9b05a1a73f9b60abfc504386921e","observation_id":"5b5c25b4-0b85-440f-b652-98f777adcca8","resolution":{"observed_at":"2026-08-10T21:30:36.527626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.282520Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"cdf4abba-a03b-4aeb-805f-b32bfbf4ee6e","year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.534132Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:5376731ac6699d11fea4c0c1ee0a54987c9a0163441e01844e93b0a8ad793e68","observation_id":"e14b3747-d2fb-430b-b096-0899bfa22de4","resolution":{"observed_at":"2026-08-10T21:30:38.289634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T21:30:36.540535Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.540535Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:25d9cf55a10992e1476d1275fb1f548572d7f9df01dc11e1afe415096d2e3c46","observation_id":"15e39f8e-855c-481f-9923-0c43491f3ba6","resolution":{"observed_at":"2026-08-10T21:30:36.540535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T21:30:36.556236Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.556236Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:c2300e1eaff433bf190b0735afe0bccab8a3ea948cdaae1954586eb60777a952","observation_id":"49cf1156-a5f3-4770-952d-aafffb4ef24c","resolution":{"observed_at":"2026-08-10T21:30:36.556236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.242354Z","title":null,"venue":null,"work_id":"ce8bdd1a-3017-4670-b149-815c7870ecae","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.561374Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:629b4d004529349955c0ede65fa156a46136e01e30e160da62ce6327e2fdf0d6","observation_id":"6f5ddf51-ea5d-4951-8760-992ffa7f679f","resolution":{"observed_at":"2026-08-10T21:30:38.251058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.210484Z","title":"Drive anywhere: Generalizable end-to-end autonomous driving with multi-modal foundation models,","venue":null,"work_id":"1a0826e8-6145-4dd7-83ad-e26fb58ea93c","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.570857Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:f394ce4eb95ab57ba65393e0a6c12eaf64cda534d22d885d92cf90eebc336c6d","observation_id":"98c8e57b-12de-4f7f-9ad7-3b42b7c86340","resolution":{"observed_at":"2026-08-10T21:30:38.222761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.172733Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"32533341-d072-4e7c-a433-8da78400c37c","year":2022},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.577033Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:4118ce9d6ddc536b9807ebadb62ee91d417316f96b9610190239117b3f87971b","observation_id":"d7181fe8-ce77-4cc8-9b33-66d1e145248b","resolution":{"observed_at":"2026-08-10T21:30:38.181322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:36.583053Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.583053Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a957ac2e18376cdaf32ca9a1977ec08a5ca46db108baea53fe03325d62c04890","observation_id":"d63dfdb6-12da-46c9-a446-3686f6de3944","resolution":{"observed_at":"2026-08-10T21:30:36.583053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-08-15T02:54:31.006074Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-08-10T21:30:36.589188Z","title":"List items one by one: A new data source and learning paradigm for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.589188Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:2fab233fe5f0bb14c98b0dc1094820f83203ceb8e3ba1c37159bec5e43ef3a59","observation_id":"25ccc62b-e148-4520-b3d1-7a631ec14ada","resolution":{"observed_at":"2026-08-10T21:30:36.589188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.106206Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":"35f2dad8-7d87-48d9-b5bd-dec6a54ad571","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.597676Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:83728f76497ed33390f2e4ed046e49a397176504f3fbb1b38eb39bfbe955d8ea","observation_id":"16276f81-c2a7-4957-a3b5-1284f8ccddc9","resolution":{"observed_at":"2026-08-10T21:30:38.118245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:36.606307Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.606307Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a44e66bbe81b70687eab716ea2534420d8de4f6479f4b16c7ce50965d409dcb6","observation_id":"107f1902-3405-4a7f-80e0-d0f480279289","resolution":{"observed_at":"2026-08-10T21:30:36.606307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.047678Z","title":"Multimodal chain-of-thought rea- soning in language models","venue":null,"work_id":"3fd77a49-6450-4045-9b97-0cf1e05dd6b5","year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.617223Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:4e31082f55afc11b4f8dfee000d6effa2f46c27357de7668c0ec53c2889e8795","observation_id":"9105b1a2-9d67-4191-9bda-b93fcbc9e225","resolution":{"observed_at":"2026-08-10T21:30:38.056246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:36.626364Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.626364Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:30ebab3641e4c580599302ec044d10d9d73e01ffcb75060c79528ade78f9f283","observation_id":"a497be7e-228a-40db-8662-6f16761e7bd8","resolution":{"observed_at":"2026-08-10T21:30:36.626364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:38.000402Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language models.Advances in Neu- ral Information Processing Systems, 36:5168–5191, 2023","venue":null,"work_id":"f98d5f73-4da7-44f8-b96d-5bd79e2c3b70","year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.633857Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:b5ffd57a30871d2ad118cc6cbecdeb2d55e4faac0bfff1a64f9c66b74869c979","observation_id":"d8dfc508-a7b9-4b03-b700-9c1c3c72fc18","resolution":{"observed_at":"2026-08-10T21:30:38.011547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.961813Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"e5e93cc9-3cf0-4dba-89bf-cf20193a2a08","year":2023},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.640347Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:587052ded1e97ede8c27ae730a4dc8e264f1f3da3d6a03eae40d912f01e738d7","observation_id":"4f8b75b4-414a-4196-8d22-946366919bff","resolution":{"observed_at":"2026-08-10T21:30:37.979560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.917941Z","title":null,"venue":null,"work_id":"ccbc9028-4d61-46fb-84f2-9be9e71bb2a1","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.647145Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:6fe80b34d8a6009f383426ef82327a35d48f559d02bef179ef7021d8a76f4abc","observation_id":"88c8e4ed-9e2b-4904-ae87-bafb6fde5c37","resolution":{"observed_at":"2026-08-10T21:30:37.929860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.888295Z","title":null,"venue":null,"work_id":"d1c06829-fa89-46d3-b5e0-f262417f8337","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.653178Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a1958fa205cf463924c826e02c88ed18a0d7c86451260cbff29946277964928b","observation_id":"03099f83-4d89-4e61-b2e7-621853fab1f8","resolution":{"observed_at":"2026-08-10T21:30:37.896710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.854161Z","title":"Replicate bound- ing box coordinates exactly as provided in the list","venue":null,"work_id":"dd2f8142-106f-47dd-9c0a-206a89c0fcd5","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.663540Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:0ab3b5550fed5d30e9e1237c45ccbcd0c7a725eb8f640763ea2dfbf142c3cc3b","observation_id":"dbf4994c-883c-449e-a3eb-f488b0e35fe9","resolution":{"observed_at":"2026-08-10T21:30:37.861424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.810179Z","title":null,"venue":null,"work_id":"bb27ef6f-2bcd-4a1c-98a7-1dbc18022879","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.672684Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:ec7ff8312d687fbfe107672727c839f35c270314baa3ae0f7d0472f2aab85626","observation_id":"b6dc4b4f-c5ef-44d4-b990-29549955602d","resolution":{"observed_at":"2026-08-10T21:30:37.822666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.766954Z","title":"1 Demonstration 1 Question: [”I am turning right at the next intersec- tion","venue":null,"work_id":"d815281a-d727-462b-aa8e-1f8635fa3c0d","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.684686Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:7e97511c0984905e7aae5b9df6618ac63c0fd3d3318c559692a1bc483e33267d","observation_id":"e89bb2bf-b40d-4a7a-a170-d73304b334e2","resolution":{"observed_at":"2026-08-10T21:30:37.786060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.739378Z","title":null,"venue":null,"work_id":"291c5406-ab88-482e-8bdd-18af4bc4f9f1","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.692496Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:20f8ac2b5a82741ccf8e06b298024b37ea8602db942ef5722fe94e795ef1ba20","observation_id":"a29777f7-d99d-46cd-b5e7-68a6d40df5fc","resolution":{"observed_at":"2026-08-10T21:30:37.748045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.691871Z","title":null,"venue":null,"work_id":"a61d40dc-b3a0-4074-816a-51983dddc346","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.699972Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:a3ae8485866ea018657e633cc0191bf23bcea878de28985b864ad6e805a2f762","observation_id":"ef6e2bd7-dc18-4447-82e3-2d448fb9565f","resolution":{"observed_at":"2026-08-10T21:30:37.711537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.654602Z","title":"correct reasoning","venue":null,"work_id":"9a79d16d-6784-4545-af91-9ad3e39d8857","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.710086Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:9c8e05279074afb81e239df49a96a43e28167b0c9eb781ee4464cb7750077188","observation_id":"f9faba4c-7921-4df5-8c31-85da6192b6f1","resolution":{"observed_at":"2026-08-10T21:30:37.661846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.626163Z","title":"Step-by-Step Instructions:","venue":null,"work_id":"6cb87250-d8f3-4711-8dcb-f4993f76504e","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.718007Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:1d8e939756fccb346f231d5ec49605a2f42f411454dbc862cc0115e39a41ef24","observation_id":"a42d84ca-e754-4ff3-aa01-48bbdf57abf3","resolution":{"observed_at":"2026-08-10T21:30:37.634427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.586874Z","title":"• For each argument, briefly state whether it is correct or not, given the provided correct reasoning","venue":null,"work_id":"042d3454-8e40-490b-9013-bdbc8c89f8c0","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.733599Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:679278bbd7b39458c0c386b1dbc049c9cde49133c2e2ca82ef96eabd627e91ae","observation_id":"0a4c0857-cd4a-4e09-9741-40eccefa8d5c","resolution":{"observed_at":"2026-08-10T21:30:37.595726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.561818Z","title":"• List important points or steps from the correct reasoning that the student omits or directly contradicts","venue":null,"work_id":"4d712aac-1af2-4877-8e12-7dbc53472b8a","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.741666Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:0750666bc6c53d29efacadc5a43588f042b2457a5ef98bdcee70f45867bff7e7","observation_id":"64ee6a68-f966-40df-82dc-1caaf70048b5","resolution":{"observed_at":"2026-08-10T21:30:37.569194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:30:37.509182Z","title":"1” if you judge the student’s reasoning is overall correct, “0","venue":null,"work_id":"d8eaa03b-dafe-4551-b40e-1cd4ded6846c","year":null},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.752852Z"},"links":{"citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:abfed24e03b59855a0adfda8485412c82a14898d40a1bfa847a64c569994998e","observation_id":"7e0f1922-d574-4a0d-b64e-7aa12ba5d9f5","resolution":{"observed_at":"2026-08-10T21:30:37.528655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:51:12.990295Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 6 inbound Pith citation observations for arXiv:2501.04671."}