{"as_of":"2026-08-07T03:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f63e2482e6a617a24acc760988276b75f1cc3fdc7d3c2520ebfa77601cfb6b2","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:04:59.948955Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22074/citation-record","integrity":"/paper/2507.22074/integrity","json":"/paper/2507.22074/citation-record.json","paper":"/paper/2507.22074"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.854687Z","title":"A survey on large language model (LLM) security and privacy: The good, the bad, and the ugly,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.854687Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:5856a59b0af340d1233ba6964192dda8edee3e75bc8d674d8ed42e9b4d5c58cc","observation_id":"eed6f0b8-80c6-4573-b526-a83907fc9470","resolution":{"observed_at":"2026-08-06T15:04:59.854687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.859067Z","title":"Visual in-context learning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.859067Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:284f90362457bf53a91f738f9d1ba142baefd297c67d26ce0ae4ba54cd9efe7e","observation_id":"a7e6307e-cf6c-4465-a6c8-7cd9e00a4038","resolution":{"observed_at":"2026-08-06T15:04:59.859067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-07-06T21:33:50.814913Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24787","snapshot_observed_at":"2026-08-06T15:04:59.862849Z","title":"Draw all your imagine: A holistic benchmark and agent framework for complex instruction-based image generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.862849Z"},"links":{"cited_paper":"/paper/2505.24787","citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:0996e4d79161f62bc52d6c1fb8c872fbc3ecebe8eaceb99eef08ceb4389c7faa","observation_id":"daf19fc4-d5db-48f6-9db2-a38e434b1910","resolution":{"observed_at":"2026-08-06T15:04:59.862849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-07T00:34:18.865020Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12830","snapshot_observed_at":"2026-08-06T15:04:59.867055Z","title":"Complexbench- edit: Benchmarking complex instruction-driven image editing via com- positional dependencies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.867055Z"},"links":{"cited_paper":"/paper/2506.12830","citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:89c9fecddb94e942c0100a1fb8704643bfe588025e9dc8dc187eea59a49d6fcc","observation_id":"e6de482d-ebe9-4236-9aca-1f6b4e645aba","resolution":{"observed_at":"2026-08-06T15:04:59.867055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.870622Z","title":"Llava-more: A comparative study of llms and visual backbones for enhanced visual instruction tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.870622Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:24aad6b65454a2344c77b4f3351ff27cd5233979b56c5ef916ba467e6b2f251c","observation_id":"84520e5a-e62f-4d17-8039-a4c51d0e088a","resolution":{"observed_at":"2026-08-06T15:04:59.870622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.339548Z","title":"What makes for good visual instructions? synthesizing complex visual reasoning instructions for visual instruc- tion tuning,","venue":null,"work_id":"12e6a37b-2610-45b1-a350-d11f686c7234","year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.874506Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:9da48f3c11429d28085b2a687453b5b1d5a22f6ddb6fd430c3e36a69c9e17e42","observation_id":"76e8ea03-cdaf-457b-8e0d-efae0b1fc29e","resolution":{"observed_at":"2026-08-06T15:05:00.343521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.327771Z","title":"A review of multi-modal large language and vision models,","venue":null,"work_id":"46943e3f-90f3-43bb-a40d-7c88402942ff","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.878977Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:ec70f877e51f1be0d22204f909f959317c00a4af68ece8ebab4c07743c64255e","observation_id":"aece26ed-97b7-41bb-a991-f1d456d6b06c","resolution":{"observed_at":"2026-08-06T15:05:00.331761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.314881Z","title":"Visual instruction tuning towards general-purpose multimodal model: A survey,","venue":null,"work_id":"78d77c1c-ec91-4a9c-9675-11195d80a8f7","year":2023},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.883186Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:baef3385700587a7c7c61ffa5c56de082a5b6db9b360f696e5dd7e378094943f","observation_id":"84fc1e5c-0a1e-4554-90ce-54a2f1285286","resolution":{"observed_at":"2026-08-06T15:05:00.319186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.302278Z","title":"Visual question answering instruction: Unlocking multimodal large language model to domain- specific visual multitasks,","venue":null,"work_id":"a8cb55ea-f08e-43c4-a827-6c35cc26c743","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.887095Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:19bc08ebd0769740ddf44a430359c653de8e8f946ec91e12270f74ba16ace28a","observation_id":"8ed50742-4e36-44c9-b86f-ad6ce0f8ac30","resolution":{"observed_at":"2026-08-06T15:05:00.306541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.290761Z","title":"Sharegpt4v: Improving large multi-modal models with better captions,","venue":null,"work_id":"352c026f-adc2-4f4c-a289-41e7a6bad860","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.890472Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:0c04e2f4e92d01f3fbea5a66c0a7dd2489e40abb25856d30683e8f2535ff67e0","observation_id":"4520a800-44e8-4f19-8a52-ca216c3f6b64","resolution":{"observed_at":"2026-08-06T15:05:00.294680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.894097Z","title":"Multi-modal large language models are effective vision learners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.894097Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:75a85aadab0217bb5e227f7463572dda827fa03991d6ea476f8a202d57d4e913","observation_id":"1103b626-32c0-4f45-913b-80a277aa2a3c","resolution":{"observed_at":"2026-08-06T15:04:59.894097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.897499Z","title":"Modeling event-pair relations in external knowledge graphs for script reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.897499Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:03d46a45fb7dc86f7cecc34dc63a3c19f9440581a19dc56c43944e4c4636cbf6","observation_id":"c8b58121-f346-4249-8102-92961db53fe3","resolution":{"observed_at":"2026-08-06T15:04:59.897499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.900566Z","title":"Claret: Pre-training a correlation-aware context-to-event transformer for event-centric gener- ation and classification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.900566Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:049d1c848ea92b0173dd3ef7b90c4bbd5417928a467dfab74344ac107f44ad42","observation_id":"06954d07-b834-4b41-a2bc-79ff76cfe250","resolution":{"observed_at":"2026-08-06T15:04:59.900566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.903623Z","title":"Eventbert: A pre- trained model for event correlation reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.903623Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:29323c507b602c5394d84d7fce496806a605f1e63b26f33618300ad04f9039bd","observation_id":"f9d596e8-1976-4f7d-b1a8-6ad16e1508e8","resolution":{"observed_at":"2026-08-06T15:04:59.903623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.246050Z","title":"UNIFIED- IO: A unified model for vision, language, and multi-modal tasks,","venue":null,"work_id":"b46349da-d14d-4d0a-9ed0-96e06a0d617f","year":2023},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.906812Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:83f03525a07098be72b88b1d9631461b5a71c656ddd1659bde6726b042280eae","observation_id":"c9e8263d-7004-46bd-b587-ee7ad934f3ec","resolution":{"observed_at":"2026-08-06T15:05:00.249670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:04:59.910308Z","title":"Beyond empathy: Integrating diagnostic and therapeutic reasoning with large language models for mental health counseling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.910308Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:2a45cdce2279753d12f7dc0fd7ae870a88625b8f97c6da197caf4c687c4472ce","observation_id":"aff49c02-5ff6-4a94-981a-7280134854c4","resolution":{"observed_at":"2026-08-06T15:04:59.910308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.233502Z","title":"Queryagent: A reliable and efficient reasoning framework with environmental feedback based self-correction,","venue":null,"work_id":"2d24ad1c-10ac-4802-8e13-77631341330e","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.913550Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:b20ffc3fbb36e52075dc3ab64c58a6cf55d2b7a4b0d68cd318e4079defdd045b","observation_id":"fb191429-c155-4b43-a552-7a70ab5fff99","resolution":{"observed_at":"2026-08-06T15:05:00.238479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.209312Z","title":"Au- tomatically correcting large language models: Surveying the landscape of diverse self-correction strategies,","venue":null,"work_id":"81137b53-a3bb-4264-85fc-8199ef7d3a15","year":2023},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.920890Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:611ed42b4c42e614578d829de99a9cbdc22d1cfa14cd95c8449311a51f5800ed","observation_id":"99b3907a-3287-4daa-9672-4f4f4f0bcb4f","resolution":{"observed_at":"2026-08-06T15:05:00.213765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.195523Z","title":"Adareasoner: Adaptive reasoning enables more flexible thinking,","venue":null,"work_id":"e3eeb681-6637-45d0-b076-94d2f6f27045","year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.924161Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:de3a1c23ec28ec7c06133a07b5e0378d612f100ce6b1f25a909772f87e050361","observation_id":"a92279bc-8044-4e9f-8ccd-e3675463f366","resolution":{"observed_at":"2026-08-06T15:05:00.199911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.183551Z","title":"Plan-on-graph: Self-correcting adaptive planning of large language model on knowledge graphs,","venue":null,"work_id":"5ec70988-6b7b-462f-82ea-f096a0cdb027","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.927819Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:47e58145fc396e53fea7a779c7f5c23612b39a44608e79a159f4f7aa1cf9a000","observation_id":"ce37a8b1-cc62-422b-8209-403a76c8601c","resolution":{"observed_at":"2026-08-06T15:05:00.187066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.172782Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks,","venue":null,"work_id":"59edb8ff-4022-41a2-b186-4ed29628bee8","year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.931589Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:cc44ea805015192b10e7919bf8dd9c1fa625cd5402f9f240d10caa2cfdcc439a","observation_id":"d3d7508e-0496-4981-9938-8fcff68440a5","resolution":{"observed_at":"2026-08-06T15:05:00.176327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.161685Z","title":"Agent-r: Training language model agents to reflect via iterative self-training,","venue":null,"work_id":"859f0dc6-ad4c-4646-8789-caef1910852e","year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.935334Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:c3d67092bb687e5914e2616add53e3da9f29d6e5d0c093a28b380af34701e472","observation_id":"a7b3811f-b8fb-4bc5-911d-e094928adcc5","resolution":{"observed_at":"2026-08-06T15:05:00.165443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19835","last_updated":"2025-06-24T17:52:43Z","snapshot_observed_at":"2026-08-06T22:59:26.083658Z","submitted_at":"2025-06-24T17:52:43Z","title":"MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19835","snapshot_observed_at":"2026-08-06T15:04:59.938273Z","title":"Mam: Modular multi-agent framework for multi-modal medical diagnosis via role-specialized collaboration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.938273Z"},"links":{"cited_paper":"/paper/2506.19835","citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:6bb80ffbc96cbd079c486ba01d91b2824b9c5a77a391a73d9598f3e9d3bb840a","observation_id":"2febc3bb-9713-491c-8298-99b41b4f4f2a","resolution":{"observed_at":"2026-08-06T15:04:59.938273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.149744Z","title":"A theoretical under- standing of self-correction through in-context alignment,","venue":null,"work_id":"3c740e91-8142-4d7a-a18c-012b0264f67e","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.941550Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:22a251214fa6d4e22db89314b0867d96beb76bb11ae5e30bb09f0a766d9b69ce","observation_id":"5392fb20-1382-4980-9e64-c6eacd653503","resolution":{"observed_at":"2026-08-06T15:05:00.153345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01377","last_updated":"2025-06-02T09:56:36Z","snapshot_observed_at":"2026-08-06T08:18:28.668841Z","submitted_at":"2025-01-02T17:37:20Z","title":"Improving Medical Large Vision-Language Models with Abnormal-Aware Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01377","snapshot_observed_at":"2026-08-06T15:04:59.945292Z","title":"Improving medical large vision- language models with abnormal-aware feedback,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.945292Z"},"links":{"cited_paper":"/paper/2501.01377","citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:4cc83bce0ab10d4e818f95577cc55f73c4d4eed3e3ae03f9a123f5f27bb43850","observation_id":"45c89ec6-7aed-4a28-8da7-873179191f71","resolution":{"observed_at":"2026-08-06T15:04:59.945292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.136477Z","title":"Igniting language intelligence: The hitchhiker’s guide from chain-of-thought reasoning to language agents,","venue":null,"work_id":"ffaeccc7-8b4a-4793-bce2-d8e8b9b0a116","year":2025},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.948955Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:f2c2ef692e51d4cb8e0ef81f6e6fd71f6a965520ccb7cf19c086066f12b04c61","observation_id":"bcd54209-dbad-47dc-ba69-c710818bff93","resolution":{"observed_at":"2026-08-06T15:05:00.142180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:05:00.222163Z","title":"5014–5035","venue":null,"work_id":"7f4210fc-d384-4012-88c5-df779b26e593","year":2024},"citing_paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:04:59.917050Z"},"links":{"citing_paper":"/paper/2507.22074"},"observation_digest":"sha256:91c2eecd4e406bbcb42727b275224327992079eedaf30d3d6260b4db4ed76cfd","observation_id":"54312aed-0e1b-4ac1-a559-fe6981de1f74","resolution":{"observed_at":"2026-08-06T15:05:00.225719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22074","last_updated":"2025-07-22T18:39:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T14:57:47.144416Z","submitted_at":"2025-07-22T18:39:18Z","title":"CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.22074."}