{"as_of":"2026-08-08T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73ae0637a7799f32da9fa1e8fdd6b8e289fb070644b695c0a3cb892228b9a48d","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:04:30.771165Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.07737/citation-record","integrity":"/paper/2601.07737/integrity","json":"/paper/2601.07737/citation-record.json","paper":"/paper/2601.07737"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T11:04:28.175587Z","title":"GPT-4 Technical Report; 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:28.175587Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:ab9dfbefcc0fcf9c8dffc06f1e02fa9402b7ffbac186c8695dcccbfa7cf2a811","observation_id":"021886da-65a4-42f4-8d74-d938d1062f25","resolution":{"observed_at":"2026-08-03T11:04:28.175587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:28.297023Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:28.297023Z"},"links":{"citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:fff4ebc6db7a4cd703aef69198da70929f49e0d4646f02477e0ecbdf0d6dbfff","observation_id":"1e342688-fd15-40f3-bab2-544540154321","resolution":{"observed_at":"2026-08-03T11:04:28.297023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T11:04:28.475209Z","title":"Qwen2-VL: Enhancing Vision- Language Model’s Perception of the World at Any Resolution; 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:28.475209Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:1f3c76e97ac661b70f61fdb24a6799d426486e56737b31c457d7d5076641a37c","observation_id":"b78909c9-3a91-4cd1-a5e3-1d2e17e38b2b","resolution":{"observed_at":"2026-08-03T11:04:28.475209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02203","last_updated":"2015-06-07T00:33:23Z","snapshot_observed_at":"2026-07-06T04:20:07.263346Z","submitted_at":"2015-06-07T00:33:23Z","title":"Describing Common Human Visual Actions in Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02203","snapshot_observed_at":"2026-08-03T11:04:28.612236Z","title":"Describing Common Human Visual Actions in Images; 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:28.612236Z"},"links":{"cited_paper":"/paper/1506.02203","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:2c34d52c41dfbfeaa825ce49cc370e1b6573c7215190ac6d5a511bd3b7a670ac","observation_id":"da682945-5c05-4646-9e52-6e78e68c7b56","resolution":{"observed_at":"2026-08-03T11:04:28.612236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:28.748779Z","title":"Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:28.748779Z"},"links":{"citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:4678266827e91eff5fcd5befb66768bff517cd98d37e3f2d769b28e20d246f8e","observation_id":"503c734b-774a-4358-90c9-0bd897f3e98f","resolution":{"observed_at":"2026-08-03T11:04:28.748779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-03T11:04:28.945250Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models; 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:28.945250Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:b0d6b53f65d34fff62ed9b9ce37daf5064ed13677897bd13fab994d30e6e5867","observation_id":"6644e92c-2524-4f1d-87c8-f18661e1a298","resolution":{"observed_at":"2026-08-03T11:04:28.945250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-03T11:04:29.114666Z","title":"Attention Is All You Need; 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:29.114666Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:19bd8d4000fbe8c2845922c33b313e119e97e41a9daa009be3576e37fc1b2d1b","observation_id":"fd3235ef-1b24-4ada-a739-6c168f2accf7","resolution":{"observed_at":"2026-08-03T11:04:29.114666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-03T11:04:29.281991Z","title":"Learning Transferable Visual Models From Natural Language Supervision; 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:29.281991Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:41c5a579e85ea44f44f1750e6d17b13b3e95ba637cc3504dff4eb1070803e917","observation_id":"0baf72b6-474a-4389-b53f-3e8334787282","resolution":{"observed_at":"2026-08-03T11:04:29.281991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T11:04:29.529985Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale; 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:29.529985Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:708b692769450a51e94b5c1c1411e0f2c10f21f1cfee657ede250711cd0cd0cb","observation_id":"44d7a4e3-1e43-4a98-9cee-66ffd9274589","resolution":{"observed_at":"2026-08-03T11:04:29.529985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:29.665318Z","title":"Fundamentals of Recurrent Neural Network (RNN) and Long Short-Term Memory (LSTM) network","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:29.665318Z"},"links":{"citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:ee11b96cfbf514238c19ef27c2f60af5dd5e9e5af3b0b36eb2de332cee33c7f2","observation_id":"b2f53301-a414-4608-9463-8e19be9d1b80","resolution":{"observed_at":"2026-08-03T11:04:29.665318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06973","last_updated":"2024-09-23T06:19:44Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:10:46Z","title":"RWKV-CLIP: A Robust Vision-Language Representation Learner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06973","snapshot_observed_at":"2026-08-03T11:04:29.801204Z","title":"R WKV-CLIP: A Robust Vision- Language Representation Learner; 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:29.801204Z"},"links":{"cited_paper":"/paper/2406.06973","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:4049f49069e3592cf2f798a83ee3b66fd11e50ae0f7510edeb1efa2cc4fe0f48","observation_id":"6b673d08-da35-4992-9893-a9ac9311b4d3","resolution":{"observed_at":"2026-08-03T11:04:29.801204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-03T11:04:29.971959Z","title":"LoRA: Low-Rank Adaptation of Large Language Models; 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:29.971959Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:e1dcb948577d469b349b6e0394f5d5ea1c24e08ad9eaa985df8462d7e95ad37a","observation_id":"cfa90d08-115c-4ace-b284-cab866ec017f","resolution":{"observed_at":"2026-08-03T11:04:29.971959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.088504Z","title":"315VerbNet: Capturing English Verb Behav- ior, Meaning, and Usage","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.088504Z"},"links":{"citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:5893708746493a07ea10e8150b61531c423129485582ab696d3a83270300e83a","observation_id":"4dd06a10-af46-46b4-9459-abc9637fa29e","resolution":{"observed_at":"2026-08-03T11:04:30.088504Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:04:30.236155Z","title":"Qwen2 Technical Report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.236155Z"},"links":{"citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:854b1c20fef1eb32baf4138ea3083bce5f820cff8ac55177cf13c2d2dfc578ba","observation_id":"e58732ef-dbf8-453b-88c9-8bad01ef3eb5","resolution":{"observed_at":"2026-08-03T11:04:30.236155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-03T11:04:30.536424Z","title":"Language Models are Few-Shot Learners; 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.536424Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:54331d4ed0bf4b2d21d61bda8861381864735118e4e316833b2f2fe5d164b024","observation_id":"fbc43bae-0fc1-48d0-adae-ac3e9101a6b0","resolution":{"observed_at":"2026-08-03T11:04:30.536424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-03T11:04:30.660635Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models; 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.660635Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:4e9f08f863c9a29ed620cdd370c7bcc96659e59ddd8f497d1dd2a4cbb950e158","observation_id":"ea1cfb8f-249f-479e-a28e-2e2d4c46f626","resolution":{"observed_at":"2026-08-03T11:04:30.660635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-03T11:04:30.771165Z","title":"LLaMA-Adapter V2: Parameter-Eﬀicient Visual Instruction Model; 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.771165Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:ed495245e8625d9447157c7f971e04208f9aab8298c04410f73ebe1b66ef2745","observation_id":"0dd2b232-20e5-42ab-95c6-669904522db1","resolution":{"observed_at":"2026-08-03T11:04:30.771165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-03T11:04:30.394667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:04:30.394667Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2601.07737"},"observation_digest":"sha256:cf0fccc59bcb07cd264b49e22eb077e32db87cbee899c99156036995c15e1635","observation_id":"0d40bf03-abe5-4f0c-bf74-05ec45ea1029","resolution":{"observed_at":"2026-08-03T11:04:30.394667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.07737","last_updated":"2026-05-26T12:27:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T21:47:03.113759Z","submitted_at":"2026-01-12T17:15:45Z","title":"Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2601.07737."}