{"as_of":"2026-08-07T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6a0cb24b31eccbb36ca36eb5dfff16624ea7239bfa17378f127d5db504947ac","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T10:35:50.838150Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:51:18.755546Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20665","snapshot_observed_at":"2026-08-01T10:51:18.755546Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20092","last_updated":"2026-07-22T12:47:29Z","snapshot_observed_at":"2026-08-06T19:16:36.789320Z","submitted_at":"2026-07-22T12:47:29Z","title":"ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:51:18.755546Z"},"links":{"cited_paper":"/paper/2604.20665","citing_paper":"/paper/2607.20092"},"observation_digest":"sha256:fa4238d577fd681c7393bd3bedda34da1e50311f33106cefe505dd28b725241f","observation_id":"ef11b8fe-3dc7-48cc-8887-094819e70512","resolution":{"observed_at":"2026-08-01T10:51:18.755546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.20665/citation-record","integrity":"/paper/2604.20665/integrity","json":"/paper/2604.20665/citation-record.json","paper":"/paper/2604.20665"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.FastVLM: Efficient Vision Encoding for Vision-Language Models","venue":null,"work_id":"4da0674a-843b-44e9-b0d3-2afdc636df84","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:ad6c27d459df584bc0e3e044000bd12d6181bbcb5aa4468a4858bedf3813a92f","observation_id":"68af16fe-7300-48c9-9cd7-9ce6eaa3f56f","resolution":{"observed_at":"2026-05-22T10:36:25.070848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":"2405.17247","doi":"10.48550/arxiv.2405.17247","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, Adrien Bardes, Suzanne Petryk, Oscar Ma ˜nas, et al","venue":"arXiv (Cornell University)","work_id":"be5fe75a-117b-434a-a95a-e6e0642fb43a","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:2b41747a95603e6a802b5cd669603f0f740bf61a581910f0e88f9c5e18ffb907","observation_id":"d795f7b7-fd97-412b-8678-9d9a03b447c6","resolution":{"observed_at":"2026-05-22T10:36:24.996880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:28.940298+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6ff5eea7-fef4-43af-b101-c27db6f1d9ba","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:0157f3829361e24b1885abeaa64cab469a2fc63d54c8426fe9ef0aaea5b414e4","observation_id":"445a12ad-6f67-4c50-adec-386e139a9b8a","resolution":{"observed_at":"2026-05-22T10:36:25.081898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-06T08:25:18.657667Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:aa95f0d7dc818a3e35a3f74b24ea9a99d801cd7e643ea71d4fbe5ad4bc18a897","observation_id":"0eb02fec-f321-4728-bf03-db7c1a25d8e8","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-07-06T20:08:34.216137Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"cited_work":{"arxiv_id":"2412.12940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12940","snapshot_observed_at":"2026-07-03T21:28:58.415452Z","title":null,"venue":null,"work_id":"1d788b85-4ab5-45cf-9a25-f1f8cd904ef0","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2412.12940","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:52921df36541e40002682a8df01613407916f249b8cbe61dd76f397e11912dca","observation_id":"4591128f-01c6-41d4-91b5-7adcbe14be72","resolution":{"observed_at":"2026-05-22T10:36:25.017520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4b5778db-612c-4dc6-8d69-be6fc2e38f0a","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:bb008891ab9378ae5c9dea2ab8db5fee0f429bf5a74e9eb35021db4c86839ab3","observation_id":"146b8b59-4bc1-455b-8af5-e3b85825f028","resolution":{"observed_at":"2026-05-22T10:36:25.077967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c98f7967-6f57-465e-86f9-d86e191619c1","year":null},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:c7e4a1a319fa69030bf4ae35cbbad2697169e8e64efbdf3e364883cec70f2a65","observation_id":"61fbecdc-c32f-4da7-ad7f-aee2dcc69bdd","resolution":{"observed_at":"2026-05-22T10:36:25.074389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"43c7d3d1-fec0-41f0-b862-fcfbea982aaf","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:169cf6346de048c77a5fb335e43444649d63c90bd492f30783c78a8fa8b9f01d","observation_id":"023d4941-62dd-4f22-8cef-16386b677f32","resolution":{"observed_at":"2026-05-22T10:36:25.067160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024.What are vision language models?https://www.ibm.com/think/topics/ vision-language-models","venue":null,"work_id":"79ab5a68-8e94-4083-b42e-8425de8abffe","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:2cfd0bcd850e1b05f20b0558a381f03ad50fcbc408c2c8118a8db79c80805884","observation_id":"313e0342-0185-4ab2-912d-4c8579ffe582","resolution":{"observed_at":"2026-05-22T10:36:25.063602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-06T06:27:32.285174Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:fb77fa6f38848289753eec2d06b4fb942a632317911480c68f73c1c13c5ae9c9","observation_id":"b1fb141f-8865-4542-a2d2-af25d41ca59a","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b15f92ba-508b-4bdd-b8fc-2c95c367b939","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:4a1690e357437e621b73cfc6b4e90f12a54d1ad0a0bb53636882ac5005cfbdc9","observation_id":"088f0cb2-9736-469c-86f7-3c32d940cdfa","resolution":{"observed_at":"2026-05-22T10:36:25.055505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.Vision-Language Models","venue":null,"work_id":"2146f28a-baa7-47f5-8fb6-22ee1572a12d","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:31286fd425268e05584f4655fab210e078b03c9f92a4212bbf7b3b218379036c","observation_id":"14baa9d3-77c1-4588-b95b-54671a85b9da","resolution":{"observed_at":"2026-05-22T10:36:25.059410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025.What Is a World Model?https://www.nvidia.com/en-in/glossary/ world-models/","venue":null,"work_id":"a37cc93e-484e-4070-a5af-7b696d8cc866","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:0c828e365d83032615ed71eff123027d2e5b7c0b0607cc88cbe65ef16deb4e00","observation_id":"4c2cf8df-b5c4-4666-b70c-b238707de06c","resolution":{"observed_at":"2026-05-22T10:36:25.051573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06209","last_updated":"2024-04-25T07:12:39Z","snapshot_observed_at":"2026-07-06T17:14:32.455890Z","submitted_at":"2024-01-11T18:58:36Z","title":"Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2401.06209","doi":"10.48550/arxiv.2401.06209","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06209","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":"arXiv (Cornell University)","work_id":"fced738d-327a-4c32-b51c-e6df45b47786","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2401.06209","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:a37a5e7a52acdadc0e3264218b049cf58b84055e44d24b81a5eee88f308e2976","observation_id":"5bf38efe-c0b3-4175-ae13-d0f1cb80751c","resolution":{"observed_at":"2026-05-22T10:36:24.988618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c898fd5e-8147-44fe-a2a1-5f6c0a9d994a","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:1f9846996b47cfb2f26ebe2e13e581592d39e6c2c6251b3a5e6be0d9739b5812","observation_id":"88f4b28a-c779-4e96-a29e-3486d318ec72","resolution":{"observed_at":"2026-05-22T10:36:25.043190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73242-3_10","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Computer Vision – ECCV 2024: 18th European Conference, Milan, Italy, September 29–October 4, 2024, Proceedings, Part VIII , pages =","venue":"Lecture notes in computer science","work_id":"63bbc2c7-6f5b-4f9a-a00d-4ff55ed177c1","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:d1d00eaf3042022dc3b15656c3e823b8901e67f9206f31b53a957ecc3fd2400f","observation_id":"0e6f627a-d623-4693-88cf-97ea49aaafcf","resolution":{"observed_at":"2026-05-22T10:36:24.936103Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:54:18.94189+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:54:18.94189+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f3be22e-b36b-403d-a197-98e8db822ac9","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:8a08631cc815db3818b0da3f7555964fff177af4d49708f20e5da498d234013e","observation_id":"00354cf3-3d68-4623-a3ca-be829883cfec","resolution":{"observed_at":"2026-05-22T10:36:25.047120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":6,"verified_fuzzy":4},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2604.20665."}