{"as_of":"2026-08-19T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b10853f0fe2a3ad06735e7cc848bd16435e855c97de311324c6427a535168f6a","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:56:25.350827Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:07.057727Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07872","snapshot_observed_at":"2026-07-31T04:55:07.057727Z","title":"VisualFLIP: Do predictions depend on task-critical visual evidence in multimodal reasoning?arXiv preprint arXiv:2606.07872,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-10T14:40:08.313631Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:07.057727Z"},"links":{"cited_paper":"/paper/2606.07872","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:e05c42b9b3ad0366d868604d16f7a110cd7d5de543ab4e103694ba98df0c53a0","observation_id":"71278e46-56f6-4aa5-b899-07d7839f5e1d","resolution":{"observed_at":"2026-07-31T04:55:07.057727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.07872/citation-record","integrity":"/paper/2606.07872/integrity","json":"/paper/2606.07872/citation-record.json","paper":"/paper/2606.07872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:be3ed4ee84f11543d3a82b80a85af41861518165e9cd06f5ba1cdfb7934c6138","observation_id":"73d332f2-dd32-4ebd-8c8b-ca19da6703a4","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:3de2e55067f3d5c3e491a23e7078a9f69fc2392704f4615c0981d3773fbef85c","observation_id":"a52275f8-ce0b-4e57-984b-863aaad56572","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:4f88d9420c2001fc96b31057219c40ab8dc5d4934459a0a271b6558e9a262ebf","observation_id":"c522db48-6a0c-4649-8630-dcf2aa7b92e1","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:5175e0a8f3063973b71f86486b2f7ee3403da06fd0305d37862b5a447b2a8785","observation_id":"9f841798-f745-407f-96a1-f3d102b2ec40","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:dfb9e9b0f30b9a768aabbd06cf662f326c60f086563100f18125ea22ac51c6fd","observation_id":"584627d5-9c19-4e5f-8730-95e127daefce","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":"2309.00267","doi":"10.48550/arxiv.2309.00267","metadata_source":"pith","pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","venue":"cs.CL","work_id":"81d8781d-2933-4e89-97ee-9bbfc6d4ca0c","year":2023},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:28583bf72aefdfee9f7ea7124e46dd09c13e97a4d83abcf6640643df4ea953b1","observation_id":"ed969ea0-d0a7-4e81-abbe-9aa6c63d10a2","resolution":{"observed_at":"2026-07-02T17:37:14.729587Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:bec7e5821291b352a6fafce1a1ce08d1e71aa32b3e3ca1f9f8eb27c06f1aee79","observation_id":"aa705132-3b4a-4c41-b429-e03bf5258b0b","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"IEEE Information Theory Workshop (ITW) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:724340f1c6bf5f862b061cb0e468fd9e6b4c0224e409bb21e17e1891fcaff115","observation_id":"4e32d530-4987-4fc1-8ead-180363bf7690","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:254d0c9f6980fffca244ed5bef5723a3f60729a5500702180e7725f7caeba30a","observation_id":"bfccbbb3-18a4-4560-86c7-fb6726d4f782","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:14a5b3254304bc5fa38cd3db1bc14bbe3e729692953854a40bed5c9698db4c55","observation_id":"f68fbdae-83a5-4502-9977-1b1dd0d008f6","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Measuring multimodal mathematical reasoning with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:dd713070db6b638c50c5e4df6a763f9034e7be3660984682c91a37a86615f551","observation_id":"eb2d31a5-67b1-4c90-9f65-08baaf04bb18","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:0df09b547736516e224627bc3eb46db1266cee6dcde53185561af3d92feb325a","observation_id":"2419d13a-5789-440b-9d2e-7ea94d4ad529","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:1a2a8f62957f023b3fdf5c3c3674ad1dfa5cf33fc35524de1b37fffcb841f6de","observation_id":"e206a514-3f72-4cde-8e04-4cad33095c87","resolution":{"observed_at":"2026-07-02T17:37:14.734860Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:1e30e0e184951699dc665226787d91c3fd52afd70a7212aa2f1a5c57a9b07ecc","observation_id":"699f6b30-2ae7-48ea-bf9d-a2785004f3c5","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:7b7fd7756684b17b54a8c2322b4bc5f19694e336a4bd9fe30532b89eceb83cef","observation_id":"1ca26c88-5f18-4b4e-8447-41e13d3204ce","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Reinforced","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:53fdcbea761be1d00cc4358be149d9e7d8bbbc9dc22fa39f743108a8ff08c93d","observation_id":"750c2649-8d1a-4be4-9ee6-c1a0006dafd3","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-19T03:51:01.804369Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:90ca6749cb6a2cd16a796d0b1742206ca22709056f6de36db8c9fa3c1b790b37","observation_id":"508d172c-b047-4f6a-9dad-28b2652407c4","resolution":{"observed_at":"2026-07-02T17:37:14.727108Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2025 , note=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:6ea36d4e42e47b516fffa3f42701a338bfcb15976fa4478ca60a6be83abf609f","observation_id":"976aaab2-d4e6-4fbc-b22c-dbcc39fe1de8","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:e9fb7f7a6792c4af281997614b3415663aade64990685ff24579fba68d751362","observation_id":"ebec02da-68f1-482d-a1e7-6828d15c6b56","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:35dff3c026a890fc5cbe3e8bea912f56a7cdf3fc13b62657676a20ea08835b67","observation_id":"e00d5c6a-ceaf-4432-9991-ad6e2ec92a2c","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:f57459e761b06971276a21da19f9a48543355904cfb659d059e8e10749e9c367","observation_id":"539e1c46-e0d1-48d8-8c9d-c248c76c2df7","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:2a4e7ecb79a4fb8a18772f066c0a8975bfb9e90a9114941891c16f029f849035","observation_id":"b6ffef6b-5e09-4a35-b845-84956410bf8c","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:44171313f70b2ffbb9c89602b8619193c18952aad26f6a7d09df86b15f21852a","observation_id":"0a3a244f-1a18-46bf-941f-6012d2f73680","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:887104e51fd602dc6fa183709efabd0ba856aab00c4d5c467ebfa41b7c1abae4","observation_id":"a4b256ae-17c0-4c8f-b230-baf1cae5d030","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-18T23:16:30.035453Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"cited_work":{"arxiv_id":"2505.18531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18531","snapshot_observed_at":"2026-07-03T01:37:30.415184Z","title":"Generative rlhf-v: Learning principles from multi-modal human preference","venue":null,"work_id":"a1e817f8-6e3d-443f-9c7a-764ae950b5ce","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2505.18531","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:27ef53ff4770b9f4bff08a138d1af8edd7b67fce7b97607aac9add02b8784055","observation_id":"674ecc18-d9f2-4006-87c0-b9d1b71c5b2f","resolution":{"observed_at":"2026-07-02T17:37:14.732384Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Findings of the Association for Computational Linguistics (ACL) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:d534f62cde0d851876e26dc2b0d1f11e850d96b1df1a0e927152dba40412c2a0","observation_id":"37bfa628-aa4b-4262-a186-6ad2a2cd260e","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:db05829e8b72043661960e50046658dba1054c29b15b92d8a41142f9444f358e","observation_id":"d281e681-3834-4a2d-be98-f3f61969143c","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:0dffefafcfa1f97289f8edc01ec77c57c89cfc220b0b6a03ab509474788d50da","observation_id":"f5029e8d-4ec8-40e4-94fd-c42b2569496d","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:40e8a0ef00998a8f74d4e4c1a145a850ae2c882d3df804105710e68f337fda06","observation_id":"96b8e16f-62ac-4ffa-a858-d00726f1f16e","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10855","last_updated":"2025-06-19T03:48:50Z","snapshot_observed_at":"2026-08-18T19:09:09.494574Z","submitted_at":"2024-10-06T20:13:11Z","title":"Core Knowledge Deficits in Multi-Modal Language Models","version":4},"cited_work":{"arxiv_id":"2410.10855","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10855","snapshot_observed_at":"2026-07-02T17:37:14.719889Z","title":"Core knowledge deficits in multi-modal language models","venue":null,"work_id":"1b1d3166-eab5-4fb2-b288-18730b4e780d","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2410.10855","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:c1dc104f8a1e440ad16c212ef76e8e1491880d125f93131bedb7478b185fa43d","observation_id":"a884c1e3-21cf-4939-99e6-08f84be51f59","resolution":{"observed_at":"2026-07-02T17:37:14.721403Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"arXiv preprint , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:53443c0aa53a65fa903dbb479f776f49541a14d66b8d6aaa9adafc3340be0c4f","observation_id":"ea4ca770-7292-4377-9394-ccc6f4431cf0","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:5051eeb0f68bf833bcda5c48533507837c9233244fcc5019ba9af6a7fb0e46ed","observation_id":"cd85c497-6722-4a59-aed0-5c9a3f6d0387","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:bd202528507c495b6d516685ceb2c5a24e3c0786ff5e92f225248a0222e33637","observation_id":"3ec7e628-920d-4307-9122-714f9dea74b2","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:290d20db57e153bf0af6d8409f05cb97f550b79b4721f70005160f256288e82b","observation_id":"9dc6c818-da0d-4feb-92d2-297293be630d","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:ded46336ceaffad2c5fe6d72dca10a5c12aa1bb6fd8ffd769fed3133c0d66e4f","observation_id":"b21ff58f-20be-4076-8f5d-4f5ecc3937e7","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:0db217bf90e36b2a3bbf893bf6365b2afa943440ea5228388864dea55270dfd4","observation_id":"5c269a40-0fb2-44d7-901d-cb10952c1ac7","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:c3acfb9094c05c5a6118886c55f84a6f35bc8912c00a725a9f5d9cca7cd30977","observation_id":"b3705f13-1356-47d4-852d-ea201afaa355","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:70d119baf49ef279bf26d5378b6d872e6805341938f6d5249c05f23ae4cd43d7","observation_id":"fbfcf12d-4722-445c-b05e-451d43bf033b","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:4c4d30fac5f633c871babfd36050427a4468ecaf4c3581ff7250039f9737d343","observation_id":"6aa2ce82-e81d-4a17-bb77-3c47471e4914","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"European Conference on Computer Vision (ECCV) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:a8f52022038f376fafe30517aaf33ebd4fba6fa6f99e319530047cb8fcd73ae0","observation_id":"ef45899a-dcaa-47d1-b134-020f1c0992ab","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:0835ee7c33afd3514f37cd73fa112554e6cec7cd28745788b9a2c3f693b42905","observation_id":"69b4caa4-90b1-432d-9c63-5a2ce0b6c407","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:9b827dabfb423bae896e7cc4df8c509e3db62d07a3477478b132a4ca318759b1","observation_id":"91f3899c-ae8a-4719-a049-be286d84c82a","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:62e70c93d3e3cc796a81f749381ce6ba992c0ee398d026de84f934b5dbeb1e1b","observation_id":"eed56838-c6c1-4f9e-8424-f50c3474869b","resolution":{"observed_at":"2026-07-02T17:37:14.725267Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:30e685725924fe44155985af0c71c26793895b27813c0217a97eb0874f69acdc","observation_id":"db57f91b-7320-4612-aa8f-87d1eebf0ef2","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:5f601838202120f2ab195cd1ef2544461dee38fe857b9aeb41b0542449c54e2b","observation_id":"69a92182-45fd-42d5-926f-0f8b5ad90819","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:77b7d2b43e5607e9c1931b4c86266f579b11f38a1027f21d501a15cb47154b0c","observation_id":"1a021567-02a6-4bba-a061-d0f84799495c","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:4859550ceb3189785ced5edad1827443694f08638659d456f048d94bf164dfbf","observation_id":"68242788-f916-4326-b8da-b0c2d94bc4e8","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:27b7594a06bc8352089ca24fca6aac4cb333ac72f584e43f6efd7cc0add04ad4","observation_id":"92c39ce5-4898-481d-9cf0-e03db47a9db2","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:81a401e75235d2061b7669ad0f5cd5134e09db1b26220656921e72aa629f1193","observation_id":"84a91cd8-3d53-4bca-a6d3-9eaf288bc9df","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:ee473c510918140ab27b5a1c1a4148dc80fa5112e70536a5e37907182b69374f","observation_id":"05b4fc9b-4bdf-4f7b-b7ba-8888138b9647","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:679bedc08d715f08e6f8b9ae31757cf4888a020875607aff94fd7dcaa06d3431","observation_id":"2241200c-d04b-49d9-b013-21908ef09004","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:85850bee7f975622d218168febe50c1b6465a9e3eae0f056a7434d78d22d9c19","observation_id":"4bf1b99d-f33c-48f3-a206-b57ecd9ff80f","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:c90e727b5efb706301aa386306c09c8400d261908b59645f40247215fe1fdf99","observation_id":"a55010a0-6845-45bb-b3a9-770fa78cc475","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:6095687d96c0c2dacd2c929b1f97e6d974fd8615314bf149da5ccd7c9e720535","observation_id":"8460547d-a7b8-4bca-953d-0b1576980976","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:e4d006652e61205c27e6370325955be47400bcad4d896722f043d3b0ee7db743","observation_id":"deee305c-093c-487d-a376-c031f9929978","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:f15ebbe3bf4f0d47006fea131a04d0fccf5ea5ed6ec773281d8671eab41742f6","observation_id":"0fcd8c7d-6dbf-4022-90f1-db1a7d94d6f9","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-17T03:46:28.942551Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:fde9c263f3c21ed8a0d9c396e1016a43e93ffb43d1beaaecf1ccacda28a90edb","observation_id":"4057ae2b-4d23-4318-bd3e-a928551dc6b7","resolution":{"observed_at":"2026-07-02T17:37:14.714347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:f642b27931f409c601c6de3325c1061b4e68b68ff4b4b14a96c8212629206d72","observation_id":"8a551125-e0c7-4011-a07f-f9247e39ee9d","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:492f7e7aa3536345a6edb0c810eef5e9b9cb87ae83cfd65b3268dd18fdb48edf","observation_id":"b694cb91-920e-4045-bd6b-fc90f482f2f0","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:127ce263894585fe07f293c0cf50bac9b15ee94c5b4890797f2a60bca8411d07","observation_id":"24b0317b-0336-4106-bcd1-92ccf13a45ee","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:ed61292f707128549fe766eaaa4833bbe31f4a1af7078db24140e85078d97636","observation_id":"320a22fc-03c9-4f1a-a0cb-79d3c3271705","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-08-15T21:58:54.708977Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:2d4512f6bb8641ec577c9dad9ecb8b04a7feea34dfb801aeeb5ae8bbaaaf249e","observation_id":"2df3f418-31bf-4016-8370-910982a0b763","resolution":{"observed_at":"2026-07-02T17:37:14.727936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:240238ac1701867d0c83925029ac5a5529facb6969ec0097ea164e7855dca970","observation_id":"95799d3a-ca43-49ee-a022-c85b85859acc","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:3b5fce4ecab2c6a82d3e39a6db03dbe01feacb0ab350b3897ea29a5875a32042","observation_id":"c647b412-f0cc-4186-93d6-3e12c22f9b28","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:cf788001aae1bb21281a51899dbd6aa820ecc02a8b1f17d6d5a25cb105e12636","observation_id":"a49e15ae-2a37-4475-a17c-eff5da1417c9","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"cited_work":{"arxiv_id":"2505.15436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15436","snapshot_observed_at":"2026-07-08T23:55:43.041447Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","venue":"cs.CV","work_id":"c157db40-f1a3-4bf3-b004-55183727b771","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2505.15436","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:cfcb44a52db1d30264f38b111040c63a1389f343b1899597badcca80a53cb5ee","observation_id":"60c5df1e-a74b-4fa3-bb79-0af9a8785e50","resolution":{"observed_at":"2026-07-02T17:37:14.738340Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:c2f023e2596e196b4a73f993ad8b1b1f02316171fb85fd416026ea4bafb42ed5","observation_id":"9844d28c-797a-4717-b509-dd1f78f179a6","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:bc08a32656cee44a358aa7d9801ea5090209b12f5f955253b2ff6b72be6ce443","observation_id":"d4e57d00-14a2-4460-aaf7-9f1c18c0d5a7","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:340d361b94591cbae9d1196df6fb2d90f49f6c0548ff3f2c317a896bc2d32771","observation_id":"d7bb54e5-cdb5-480c-a27b-a3268d127168","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:02d8035d1e5d22e45d0e7093cbf700df188de3bb5247b3792b90a92a11b711ae","observation_id":"03a88d1d-cdbf-46e3-b22e-7c53649505ee","resolution":{"observed_at":"2026-07-02T17:37:14.735843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:b611518f184dd84bb2f2d90c742e8b46820ea58b278c4f9b6ef50e91312352b5","observation_id":"952f409a-169a-4664-9c65-c5e043ef424e","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:4df02270314cdaf77b235614110be2485d91175635497fa3fa0244a9f87706ba","observation_id":"7a4a9ffe-31e3-4f13-8e72-14acad64ba3f","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"2024 , organization=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:20cf50548f4d16c25c271b185cf64b866e396d8fd744bbe4f28ff1618442b936","observation_id":"6e2017ee-ae65-422b-b30e-b3f5af86b2f3","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:b81a4e05399ba9f87518ec2449f81d2ad02967fdd74172a18f5a30e55e149e1a","observation_id":"14a2a29d-54bb-4749-9bc6-efca804c7d47","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:413a89d043cb7e7e428b6d22d97f906eecd60cdc8f1325d12abce909a52829ad","observation_id":"05bfeb6d-75c0-463d-91d5-68b08a3d8c06","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:2e01d95ebecd84826b552eedfc0e7bcb3307a9c14c19f524bd7fc663943314ba","observation_id":"0dd96faa-e6c9-4b3d-a9ab-1874a1344665","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:37:14.732005Z","title":"arXiv preprint arXiv:2509.25851 , year=","venue":null,"work_id":"140306c7-aeec-433e-b625-bb641f496f32","year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:13706eaf28bfb68c14a6dc27fe825882d2c3ad39ed4c9c86f0ef1885654d8b6e","observation_id":"d33f68f7-a0b5-4534-b9de-562ca6c29ec6","resolution":{"observed_at":"2026-07-02T17:37:14.733611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:c07df3d50474a8c8974592901d9e71100a10d990f3fa841c6a8591950bf87873","observation_id":"e8f5446e-4a58-4bd0-977c-1adf954666e0","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:b8e5b9a01e5851897525e21b39ac1981f3a1fb7cbf1f7a26a8eca89eaa969342","observation_id":"6755ed33-205c-47fb-8950-6b0299a6d07e","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:d1986fa30e67b00c7c4adfc21231c95103bc48fc98874210978705bfca591311","observation_id":"bab4ed2c-c313-4db3-ad57-99397397d831","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:97337bd4ef1af7fd688e5d108dbde555c650f39f9b5e8d0a40bb344b37d1eb51","observation_id":"a6ba0b98-c64f-415b-86a7-e437f09fa01e","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:56:25.350827Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T21:56:25.350827Z"},"links":{"citing_paper":"/paper/2606.07872"},"observation_digest":"sha256:87728f9034cefb85ee6e63c34d42e6039f886789d5199135d03969d5f9acf767","observation_id":"2701cfae-4f31-4a90-957b-dea0f319637b","resolution":{"observed_at":"2026-06-27T21:56:25.350827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07872","last_updated":"2026-06-05T22:06:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T14:28:27.436111Z","submitted_at":"2026-06-05T22:06:07Z","title":"VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":71,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 1 inbound Pith citation observation for arXiv:2606.07872."}