{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fe7a41fc44df8ed492caef9d32788047237a0a8d1a7599383eaef39b97f8694","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:07:36.844173Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T09:54:33.563266Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11571","snapshot_observed_at":"2026-08-01T09:54:33.563266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27304","last_updated":"2026-07-29T17:11:52Z","snapshot_observed_at":"2026-08-05T11:12:14.452671Z","submitted_at":"2026-07-29T17:11:52Z","title":"Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T09:54:33.563266Z"},"links":{"cited_paper":"/paper/2506.11571","citing_paper":"/paper/2607.27304"},"observation_digest":"sha256:00fbe081485f8eb0b9f431ae3749473cde50c97e8aa91be839b5e5ac8f28dafd","observation_id":"9f88081b-4638-42e2-99c6-e46901bbed90","resolution":{"observed_at":"2026-08-01T09:54:33.563266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11571/citation-record","integrity":"/paper/2506.11571/integrity","json":"/paper/2506.11571/citation-record.json","paper":"/paper/2506.11571"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T04:07:31.587700Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.587700Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9b05704c4f623d5127d86f2de2adaadc595924be1be5bdf6b9f652dfab480a5a","observation_id":"0abaabf4-c43e-48f3-8d8c-ed11ae2f1b6c","resolution":{"observed_at":"2026-08-07T04:07:31.587700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:31.660752Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.660752Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c06967e25fed4fd4003ae8aca8126346b2f6e034fb2dc6e1bc20fddaff6915ca","observation_id":"de2de84e-4f9d-4c43-bdca-87a18ce0ff6b","resolution":{"observed_at":"2026-08-07T04:07:31.660752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T04:07:31.703713Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.703713Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:e2e471942c082f1321a3f2b86d47a7f0e069e9c59b127e97753718284d0b6b81","observation_id":"7637cb9b-dc85-4776-8ff2-9efccd7b9cd2","resolution":{"observed_at":"2026-08-07T04:07:31.703713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-03T06:33:01.378310Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-07T04:07:31.778408Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.778408Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:22643c52333f2d1f1b1b6128a256b5358d6754765c555e78f0b2f685973d36fb","observation_id":"adb9539c-bbe9-4d46-bc61-7e061c22ee24","resolution":{"observed_at":"2026-08-07T04:07:31.778408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-07-06T18:20:05.707144Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T04:07:31.820419Z","title":"M ˆ3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.820419Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:0ae2944abfd3a22cec62bfa78fa32c7e2ccfb16419292d9af8d12448db16e3fb","observation_id":"de2f71a6-6d3e-42c6-bc3f-951120f45647","resolution":{"observed_at":"2026-08-07T04:07:31.820419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-07-06T14:40:50.270024Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-08-07T04:07:31.881851Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.881851Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:53a70af8ad0421043bf7d08dc125783301cce9726664eb3c09122ad55c8f8228","observation_id":"6eee8200-8caf-4adc-98e2-211589b90ad5","resolution":{"observed_at":"2026-08-07T04:07:31.881851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03287","last_updated":"2023-11-07T02:18:48Z","snapshot_observed_at":"2026-07-06T16:43:42.741094Z","submitted_at":"2023-11-06T17:26:59Z","title":"Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03287","snapshot_observed_at":"2026-08-07T04:07:31.956173Z","title":"Holistic analysis of hallucination in gpt-4v (ision): Bias and interference challenges","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.956173Z"},"links":{"cited_paper":"/paper/2311.03287","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:f72223a8470ef853606d72e9998ca01fa05f56447061e503b0be5d9e3a656d1c","observation_id":"bbef4c86-23a9-4ba7-b7a3-cc1c5e026a43","resolution":{"observed_at":"2026-08-07T04:07:31.956173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03230","last_updated":"2024-05-07T11:55:10Z","snapshot_observed_at":"2026-07-06T20:17:15.995064Z","submitted_at":"2024-05-07T11:55:10Z","title":"Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03230","snapshot_observed_at":"2026-08-07T04:07:32.061606Z","title":"Video- of-thought: Step-by-step video reasoning from perception to cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.061606Z"},"links":{"cited_paper":"/paper/2501.03230","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a4d09d603c558e2b5a78273ca4e8fef63c4cfacdeb5d35c9cddfb7fced725890","observation_id":"90ecb6a8-ce9f-4510-9908-270fc34ff20f","resolution":{"observed_at":"2026-08-07T04:07:32.061606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T04:07:32.177092Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.177092Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:b495d48a06d2f0faec75a6459f719a5d3156fc0fb7dffeebd1ceca2932230d3b","observation_id":"3a649fa7-a297-4640-82a1-1d40ae8fa644","resolution":{"observed_at":"2026-08-07T04:07:32.177092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:32.289278Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.289278Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:7d624a07d981c5c0bf0346d5ff282f05f0274d435fcc41f1ece92dee9e997b07","observation_id":"a7ef88ad-7914-4c91-a6e4-0f7584eb693b","resolution":{"observed_at":"2026-08-07T04:07:32.289278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T04:07:32.364515Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.364515Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:d1c58d280a5fca330cc77095fedb18f7133ad11fbf6179ad47ae67e4a732a8ea","observation_id":"aa453ad4-0ad9-4b46-8019-78d046e0a629","resolution":{"observed_at":"2026-08-07T04:07:32.364515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:07:32.480638Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.480638Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:78f0a9aba0d2d84d5287514a5af5231ee552c7b69ac93c518441e039a0a5ddab","observation_id":"d0a20dea-c999-4157-9586-0d4a6ec543f5","resolution":{"observed_at":"2026-08-07T04:07:32.480638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T04:07:32.555893Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.555893Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8a14250bcb5c02d49498fc33986819a9b0c035369536aa09e74a368d67d72790","observation_id":"73d92c24-9872-40ad-a9a1-082c9a2b7a66","resolution":{"observed_at":"2026-08-07T04:07:32.555893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02301","last_updated":"2023-11-24T07:07:03Z","snapshot_observed_at":"2026-08-03T03:23:08.919296Z","submitted_at":"2023-09-05T15:06:37Z","title":"CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02301","snapshot_observed_at":"2026-08-07T04:07:32.651474Z","title":"Ciem: Contrastive instruction evaluation method for better instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.651474Z"},"links":{"cited_paper":"/paper/2309.02301","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:de5fcebb198fba9d9837ea86e7a1b0fb51aaa0388f2a0c49223404c65ac41deb","observation_id":"0ff9ea26-f393-4506-9922-25216861501e","resolution":{"observed_at":"2026-08-07T04:07:32.651474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:07:32.738113Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.738113Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:fe296116099e0bb281c286ea1603fd1199832615be3f8c0f3cdd997d942050bb","observation_id":"57369070-914b-467a-9d5e-4de52cf965ce","resolution":{"observed_at":"2026-08-07T04:07:32.738113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T04:07:32.813269Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.813269Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:5422217f9dee70d9c498765f2ca9c240605a1a2762c7d0f688698e79a8c90cbb","observation_id":"80a94db2-df0c-498d-a628-6311cf99e159","resolution":{"observed_at":"2026-08-07T04:07:32.813269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:07:32.918115Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.918115Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:413415f344f624af18ba418a84ea0919a826b02a206e037b64bd3878d99b84bd","observation_id":"35009f1b-316b-4e07-a07c-a50ae55b903a","resolution":{"observed_at":"2026-08-07T04:07:32.918115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T04:07:33.024804Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.024804Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8f4b51c6ee92f525b5fadeb8635378305b69be76a4e074f8a76daedfc71ffd3a","observation_id":"9876737f-06d9-4d91-8603-06bd20891a76","resolution":{"observed_at":"2026-08-07T04:07:33.024804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T04:07:33.115300Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.115300Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a8be1b8e5612d6f657dc4dfa61b7988393ab74b3c60e31d717b7dd8b26ee84c8","observation_id":"9a2ee76d-092a-4c18-a14f-371f0b13bfe2","resolution":{"observed_at":"2026-08-07T04:07:33.115300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:42.210715Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ad5e7418-e57b-44ce-acb8-a3b5fdea9712","year":2022},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.208153Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9693272c391f474e3c2b0494759b24e6c4f44f9cbecbf30904b069d9bef12f70","observation_id":"b759e0a0-aa7d-4e6b-bd61-b01086fb387b","resolution":{"observed_at":"2026-08-07T04:07:42.342580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03321","last_updated":"2024-10-04T11:18:41Z","snapshot_observed_at":"2026-07-06T19:27:37.936219Z","submitted_at":"2024-10-04T11:18:41Z","title":"Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03321","snapshot_observed_at":"2026-08-07T04:07:33.318843Z","title":"Visual-o1: Understanding ambiguous instructions via multi-modal multi-turn chain-of-thoughts reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.318843Z"},"links":{"cited_paper":"/paper/2410.03321","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:749b5d585a30f14b9414ffccdc6a367c6293004be71fcb9014ae22194d2dc158","observation_id":"70c288f9-a8eb-4fdc-b88e-b5b704dabdd5","resolution":{"observed_at":"2026-08-07T04:07:33.318843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T04:07:33.434821Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.434821Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a64f34092c39d93b955658fbc2c76ee9df11263f6087cf71c9b4890341d82a96","observation_id":"a3e949cd-5a64-4d0f-8c61-d0672c991c69","resolution":{"observed_at":"2026-08-07T04:07:33.434821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T04:07:33.560796Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.560796Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8154abf271c576b4227104c632f2a711441264583377ada54abd805781f4283e","observation_id":"5f578a40-6dee-4156-92a5-2592e763fa5b","resolution":{"observed_at":"2026-08-07T04:07:33.560796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:07:33.622232Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.622232Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:56c06d57ffe80a0297b07542720756ce3ca7dfecf89981696f044e582d7d78e7","observation_id":"c6091be3-7e48-42a5-8e95-8f6c51e6a581","resolution":{"observed_at":"2026-08-07T04:07:33.622232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T04:07:33.722511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.722511Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:52dcbf39c8ad90769bc2546b276ee9fa0b70d8f4e30bbd060794eb7552242375","observation_id":"9024d70c-e031-4c04-90c2-80499c3da584","resolution":{"observed_at":"2026-08-07T04:07:33.722511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-06T08:11:40.349176Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-07T04:07:33.839250Z","title":"Behind the magic, merlim: Multi-modal evaluation benchmark for large image-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.839250Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:b7679736535deaf420fb21d5724b362fdcadbe4debb163ea6d09d107b5516382","observation_id":"0c4133bd-d41a-42d7-8080-f873a69e81af","resolution":{"observed_at":"2026-08-07T04:07:33.839250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.895799Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"5115828d-a831-4b7b-99e1-f4af6a9cefae","year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.917505Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9379e579608b5a6db2f44833d156ac95739be1ef1aa64a86e14582a4a3429825","observation_id":"d38dc04e-cd60-4b4d-9a3f-f55c27fbb8e2","resolution":{"observed_at":"2026-08-07T04:07:42.037028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T04:07:34.024686Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.024686Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:57d1c80d89ac8b2ea0a7f282fece19e1577777945a8ad78bfcc758a95d3d7de6","observation_id":"2edb0dae-c5a2-4436-b1b9-2868fed6b484","resolution":{"observed_at":"2026-08-07T04:07:34.024686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:34.166022Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.166022Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:07be40a0371e84452aac3dc6be64c219dd0f711b5d809de2c81c29ed0b4a86e3","observation_id":"0793f6ff-3665-447c-b54b-3f85c43aa745","resolution":{"observed_at":"2026-08-07T04:07:34.166022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T04:07:34.276313Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.276313Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a32e70bb38180b52a92d29a1013992abe44f53fe98e291bbd16e096988b6d920","observation_id":"2642020f-54ce-45c5-b412-27e43624b0ba","resolution":{"observed_at":"2026-08-07T04:07:34.276313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-07-06T20:19:11.931638Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-07T04:07:34.362773Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.362773Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c3ed82655529f721ec4d7265dfe95858f1ed54660adc81227c2087cfabe98c1e","observation_id":"1165e788-0faf-4ce7-b2d3-b886ed25850a","resolution":{"observed_at":"2026-08-07T04:07:34.362773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T04:07:34.464471Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.464471Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:e5fe3413f6a635584527e17d7cf65c71ac9a219f112874f25add1819e0fad307","observation_id":"b10a50c3-9317-44c1-8011-5dd93ad91905","resolution":{"observed_at":"2026-08-07T04:07:34.464471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T04:07:34.579200Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.579200Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:6714243e7dd04c6fac2e10f4006436696183b7643f3403fc9590910defc3b5d9","observation_id":"64848bed-8331-43f6-a7f8-50025735980f","resolution":{"observed_at":"2026-08-07T04:07:34.579200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-02T02:03:01.950155Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T04:07:34.668498Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.668498Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:728188391009f83f190e10bdf253e0a48690aeb185d8356e8044c275a8844a53","observation_id":"f848019f-2edc-47ec-a455-f1c34aded2ed","resolution":{"observed_at":"2026-08-07T04:07:34.668498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T04:07:34.753888Z","title":"Tree of thoughts: Deliberate problem solving with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.753888Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:cce95af1d4fb64ba59f54600171e91a0323e9ca133b5fa4d34b5457276292fcc","observation_id":"ab18994c-87b4-42b1-a5fe-574d3fcc4437","resolution":{"observed_at":"2026-08-07T04:07:34.753888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T04:07:34.797292Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.797292Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c5c2f002e46ddd84ec07250f846295ccb8f1ece98fd574b5dd8d1ae23037d9be","observation_id":"907799d7-17df-4531-9005-ab4ee4715382","resolution":{"observed_at":"2026-08-07T04:07:34.797292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:07:34.864725Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.864725Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9627efae67ccfd0f301db3eaa2154e63c4acdad09dad4307fc90d74d05cf5f54","observation_id":"3cbee560-f79c-4c3e-850a-a752a3295f19","resolution":{"observed_at":"2026-08-07T04:07:34.864725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.718993Z","title":null,"venue":null,"work_id":"0c776764-e2d0-4d97-90bc-258efde89c09","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.953774Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:546c08d3c255784b5b65c23c5cc7db62eee7cc6f6e6daf21063a248fdfc487bc","observation_id":"20999872-3733-4c93-b6a4-1859a808f77e","resolution":{"observed_at":"2026-08-07T04:07:41.794677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.612525Z","title":null,"venue":null,"work_id":"6824b123-4653-41bc-aa7e-70bad4fb6cff","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.041699Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:6937932c7cf1596ab9011f1b91480da82c08a6a46deeecad37f50a777e65edc6","observation_id":"5f681d69-358f-4b4a-bfa6-f689294ea924","resolution":{"observed_at":"2026-08-07T04:07:41.652440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.430787Z","title":null,"venue":null,"work_id":"6f0883f5-e602-44ff-a68c-18a970ea30d5","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.156688Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:3fc49eabdc517333ec4c0c560054c8a101dcd083f91d7aab230394a44b0296a6","observation_id":"98dcbe5b-8481-4df7-a5c6-8d29ffa9a212","resolution":{"observed_at":"2026-08-07T04:07:41.516516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.252722Z","title":null,"venue":null,"work_id":"406f973a-3e13-4415-9a88-bd9017c7b554","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.228622Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:34b8e3efcdf07d473227a0b8183ef424f8cfc2dd046300a7bcc3906fc49449b4","observation_id":"f842e7a6-5627-4b8f-b46b-b6a0001c49c9","resolution":{"observed_at":"2026-08-07T04:07:41.348976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:41.029245Z","title":null,"venue":null,"work_id":"fe8ff26e-482b-48d6-8b92-97bd577bad10","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.271391Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:86a8c63d0ea789c99b302ff73f9742b980be9c4fe0bb156c6d773a6385a5c17a","observation_id":"31826df4-9b47-4a54-976c-26c18e42758d","resolution":{"observed_at":"2026-08-07T04:07:41.133657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.790676Z","title":"The screen visible in the image is small and not a touch screen","venue":null,"work_id":"46f60906-771e-4259-80a0-1b7b851d4a05","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.356982Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:92ed63da8bcdd37cf7417da128ebe3336e5f76ebb4131b731d88f580333608b9","observation_id":"aeb8bcfc-5433-4087-b4dc-e468a5675797","resolution":{"observed_at":"2026-08-07T04:07:40.932629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.541714Z","title":"This option is speculative and cannot be confirmed from the image alone","venue":null,"work_id":"733785b8-3ce9-4783-8319-0cbdcaed0d6d","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.443459Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:96de50ce9d109aa6388b967cebbd72b0c4868e0dc1b0f44cbdb2f1164ae6ae7e","observation_id":"3176c547-2f17-4fcb-bf8b-c8dfe69166b4","resolution":{"observed_at":"2026-08-07T04:07:40.667712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.266255Z","title":"This option is likely correct","venue":null,"work_id":"11d0130a-e97d-4fca-b944-42ab12dfed75","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.521699Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c16d99b9a2923ac80b8be0a31b099d999d9cdeb4d8f333870876f97b706e1b82","observation_id":"85f92ca6-d4c5-419e-9a24-4d2b0a23fd56","resolution":{"observed_at":"2026-08-07T04:07:40.401958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:40.048226Z","title":"The image does not show any indication of this technology","venue":null,"work_id":"14a83b98-b396-451d-bc10-c5d5fac85ca8","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.582676Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:c09660537d743006974b5a93f8e0dbac339100a9ce055f44316e891941dadb80","observation_id":"223a4946-abc7-4129-9639-9c05df960629","resolution":{"observed_at":"2026-08-07T04:07:40.194944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.856500Z","title":"<vcues_2>The screen visible in the image is small and not a touch screen</vcues_2>","venue":null,"work_id":"3c41129b-28c7-4295-bc40-1a1c4fcce147","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.669343Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:bbeb3d0e3ba64640d7e9b1b4e99e12ecf487ce6d7f6f51745baeb66ab4cf2835","observation_id":"9ef69d52-90a2-4fa2-aef9-a1de3c5d9348","resolution":{"observed_at":"2026-08-07T04:07:39.964892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.692821Z","title":"</vcues_3>","venue":null,"work_id":"d57e7715-b730-4883-87e4-d6ee5a4d94d3","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.723483Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:50b46c7e176de20e71bd4506ae634b1c0b7ce11e7b9f04380b4745298f7c6623","observation_id":"ca1fb7ff-5e97-4513-9931-84e7dfb958d2","resolution":{"observed_at":"2026-08-07T04:07:39.782624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.483079Z","title":"This option is likely correct","venue":null,"work_id":"d6bf1933-ed0d-4715-9d17-0509389e36d6","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.756741Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:090f5352bc2fe890f9993231874aaf1c38815f9ad279841779ff17c1b29f2cf9","observation_id":"03bc4ae7-ed92-4abf-b66d-ce84abb40fbf","resolution":{"observed_at":"2026-08-07T04:07:39.570953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.334910Z","title":"<vcues_5>The image does not show any indication of this technology</vcues_5>","venue":null,"work_id":"c97de924-3f6c-47ac-a2f6-b5e15ef8cd9d","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.811204Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:943c9debd6f647bbc91545139e4b35ee4fc0dc54e0c9b01f0e0bb3b973946f5c","observation_id":"93890703-e101-4190-9a39-d083b9789e5e","resolution":{"observed_at":"2026-08-07T04:07:39.399955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.211011Z","title":"<vcues_2>The screen visible in the image is very small and not a touch screen</vcues_2>","venue":null,"work_id":"f3a6cfbc-367d-4129-a87f-d3150b7e2663","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.883434Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:24a7c2b271c4c0f40e8c0183e62d3c1e05e1e51c3388e54107e4ef040081c048","observation_id":"86ef2ce4-a475-454c-a7bc-9a658381ebf6","resolution":{"observed_at":"2026-08-07T04:07:39.293227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:39.034946Z","title":"Therefore, this option is incorrect","venue":null,"work_id":"365cd7ce-146b-46dc-9487-0027fb748af5","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:35.976409Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:6976f1569eba11829dd42c691289de36e36025f3508df1baf21b788f600ff624","observation_id":"a5ad5350-509d-4b95-a5f8-da23aa4ca87d","resolution":{"observed_at":"2026-08-07T04:07:39.113386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.921478Z","title":"This option is correct","venue":null,"work_id":"ff9f7d91-490e-4c65-8879-9109541d1d8f","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.012004Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:bdcfb2a4c8c72a0726d060020f5d6231d75fef34889ed74e13abef5aecd6bb22","observation_id":"47154189-fc59-433a-811a-67dce248275b","resolution":{"observed_at":"2026-08-07T04:07:38.971452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.726498Z","title":"new_option","venue":null,"work_id":"ea8d07b6-0dd6-42ef-8b6a-1d99831d8a3e","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.086645Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:4db45abb104d24d3f76034fc076ecb372dbd1d0cf6a5ddae87cbaca168db6334","observation_id":"c073b7ea-f187-44a0-936e-fbcc93b2c171","resolution":{"observed_at":"2026-08-07T04:07:38.796243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.605671Z","title":null,"venue":null,"work_id":"a6f8f3a2-554b-4f2c-8a15-01eeb6acced6","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.188559Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:6ec084a0f2bdb9400f794b1a9f3db2d773e853878f7113c6d0de07855a54d97f","observation_id":"c9f65da7-5d69-429c-b231-0e8f3e28b1f1","resolution":{"observed_at":"2026-08-07T04:07:38.666183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.496005Z","title":"The presence of dirt could be from the environment it has traveled through, such as dust, debris, or even road salt in some areas","venue":null,"work_id":"fe1c55ce-f949-400c-8a8b-885b4aa73ad3","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.276358Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:fd631fd641a698de7171bfe9aa5e98d6e7f7881f9488de1c08d117b423d5eb03","observation_id":"b7d41924-d39f-4128-ac98-7de16039e3d0","resolution":{"observed_at":"2026-08-07T04:07:38.554796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.327996Z","title":null,"venue":null,"work_id":"2c47a5b8-6bd0-4be4-bcfb-91f035d051a9","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.364831Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:31adccbcd6fd96778caf87042edf09e09ed671cd1157f9f6506057fec77814bf","observation_id":"b4f9552f-97e2-435e-adae-3957608376dd","resolution":{"observed_at":"2026-08-07T04:07:38.421824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:38.077527Z","title":"The train was caught in a rainstorm: While rain can cause dirt to accumulate, the image does not show signs of recent rain, such as wet surfaces or water streaks","venue":null,"work_id":"322746d1-7874-431e-bcb5-183701e6f0c3","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.449471Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:ead682b63e8c88559077675cca0da98e5e184b4f8e5dad6a25ce2a182cdd5ff1","observation_id":"72575578-c4d6-4e54-93ac-36c4e9d7c5c3","resolution":{"observed_at":"2026-08-07T04:07:38.195822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.827434Z","title":null,"venue":null,"work_id":"7682a491-9e11-4198-b56b-af999c17f58b","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.536880Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:dec6f766e703bc0bcc61ed4e74ed2212c25e0ecbfc0c227abc0db19d7dbca8fe","observation_id":"655077ef-3a7b-479a-b7ff-2410614e6255","resolution":{"observed_at":"2026-08-07T04:07:37.953934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.565642Z","title":null,"venue":null,"work_id":"04cbbc95-8574-4c28-b308-42bd0291544f","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.603461Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:b475e531ad2831ad85034114d7166456d00ff681cf4c5057a057ae86d0096b4e","observation_id":"f339e64e-a48b-4402-ab33-5d9271709600","resolution":{"observed_at":"2026-08-07T04:07:37.681408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.456603Z","title":null,"venue":null,"work_id":"17d99966-b923-45bb-8f0f-d43073a1e1d4","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.704682Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:9c1aa7c90318198691b0e584ba377dfab0b5741268925b6cb196d1cc6ad3e42b","observation_id":"d9a69d1d-bb67-4fcd-9848-5b7df5cd8ab2","resolution":{"observed_at":"2026-08-07T04:07:37.501653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.360351Z","title":null,"venue":null,"work_id":"3ef94acb-ac0f-4729-bbf8-032733e21167","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.792454Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:14d16ab4d7d20c6948971dc76dc3f1b487ab01e56732e76905a01a653efa641d","observation_id":"885b32cd-a831-483a-838a-0b01f99498e6","resolution":{"observed_at":"2026-08-07T04:07:37.393645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:07:37.291326Z","title":"Given these observations, the most reasonable inference is that the setting is a small residential room, likely a bedroom in an apartment or a small house","venue":null,"work_id":"9382c88d-abbf-4c58-ac37-b615e383e6d5","year":null},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:36.844173Z"},"links":{"citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:45671121e19af4c0fabe33e60399ceb05073e77d604db79b3697d2d7464190ba","observation_id":"958fcb89-84a5-4a7d-8d98-5019d2c34456","resolution":{"observed_at":"2026-08-07T04:07:37.321432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:16:47.335034Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2506.11571."}