{"as_of":"2026-08-16T18:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88d511ba1899050a0b856678dc3cf847093c3f381a39f4161f6339d21d927aaa","coverage":[{"denominator":266,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:09:17.882743Z","state":"measured"},{"denominator":118,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":118,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:17:33.785540Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:52.515977Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2504.21850","last_updated":"2026-05-14T18:32:02Z","snapshot_observed_at":"2026-08-16T08:46:08.684546Z","submitted_at":"2025-04-30T17:57:22Z","title":"Visual Compositional Tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:09.890605Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2504.21850"},"observation_digest":"sha256:3081952bb57765296410414dc7b81a48be3a54f9d11883d2100f669d12c7430c","observation_id":"29394350-4395-427a-a682-5f18b5a73c2a","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-03T20:57:29.860215Z","title":"Explain before you answer: A sur- vey on compositional visual reasoning.arXiv preprint arXiv:2508.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-14T07:35:41.065056Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:29.860215Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:dd9b7e3c89171c09cf10503870d78c0d3b8a5cb353a83c8d86d35fcc15d67b5f","observation_id":"ebf4352f-6fef-4a35-8e24-3dbbcb426783","resolution":{"observed_at":"2026-08-03T20:57:29.860215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-08-11T07:20:28.569646Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T22:57:04.802871Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2512.10941"},"observation_digest":"sha256:02da041b326c14dfb420859ab746a1941c46a6189ecc52c96805302437c03ff5","observation_id":"bd14d4ff-deff-46a7-baa7-ea0fadf4891e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.13313","last_updated":"2026-04-14T21:28:46Z","snapshot_observed_at":"2026-08-13T15:13:50.391868Z","submitted_at":"2026-04-14T21:28:46Z","title":"Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:57.169737Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.13313"},"observation_digest":"sha256:67c267f4bd3f8794a3bf526d0174764803b43915bb1435f6a71ede55ac95458d","observation_id":"0c472c11-a78d-4401-866d-41d28e17055c","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-08-14T13:38:39.932714Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:39e1add872eae1c2c483953bd062d8e39c1ad212096ef6f9827296df61adf5d0","observation_id":"fb7f47e8-e6dc-4614-bcff-b50c7d0c8fd3","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2508.17298 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-08-14T13:38:39.932714Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:1128f128741105c40f9c80700f57e4aea1cc62cd8ef9a46f28dc7ab1b504578d","observation_id":"58a0db0e-ef8d-42d6-9981-1ec18f092e7f","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T23:56:02.856878Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:8cb217764a2e3b01e77a779c2864b74b341b766c1075ccd3fed00f2cded04d1a","observation_id":"ac0e57e9-6067-4f03-b674-14f2ab0d56d3","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:63aedfbb97123a6e772f7159e41002887899690f32235806735edd3c7230485d","observation_id":"b1fb141f-8865-4542-a2d2-af25d41ca59a","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.00943","last_updated":"2026-05-01T07:11:58Z","snapshot_observed_at":"2026-08-11T08:31:36.256032Z","submitted_at":"2026-05-01T07:11:58Z","title":"ARIS: Agentic and Relationship Intelligence System for Social Robots","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T19:24:45.954058Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.00943"},"observation_digest":"sha256:9644fb3a452908ec9d189b8af86e510623af6441a91864b5fe3dfc34bf80be83","observation_id":"7b62a7a6-9669-4863-8b9d-7ec826435d21","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:45:35.282421Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:558cf1d395d9d1c58b30a0fdd3d5a60535199c55df97c9aafdba74c9f0743e05","observation_id":"a4274836-00e4-42d0-8f9e-846c186d3db9","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:09:57.202867Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:8c5f5102e163518a4933d6d0b25522140265115442af066119b15149f1048392","observation_id":"5ee90f4c-549c-4719-886f-36445f090c3e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:46:26.117927Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:02ed160ce534d7d6042c5f9d0705102aeafb043aef530805f9aaf83f5f52551a","observation_id":"8fd5c76c-67fe-4ad7-ad5a-cdd969354892","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-03T02:22:11.160316Z","title":"Explain before you answer: A survey on compositional visual reasoning.arXiv preprint arXiv:2508.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-14T22:04:51.869204Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.160316Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:f3d9cfe548b01f3cbdb829c19ccacded0cfe811c842decea135fe648a12e3051","observation_id":"f249f835-12cb-48f8-ad7b-7876f7ebab44","resolution":{"observed_at":"2026-08-03T02:22:11.160316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2605.23602","last_updated":"2026-05-22T13:11:23Z","snapshot_observed_at":"2026-08-16T00:21:12.948923Z","submitted_at":"2026-05-22T13:11:23Z","title":"GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T04:59:57.934468Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.23602"},"observation_digest":"sha256:1c260be905d698badac35a52c4c40e1893c0c19e9285fa547c4398f45beb3014","observation_id":"6f9d7c78-088b-4eae-938e-c9872e5efe55","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-08-15T12:27:32.305698Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:167c0f51c0b858167ffdf3340059d4d62fc013bef1b0938f34442c1faed6fa50","observation_id":"bcf55865-2ecb-4bf6-907e-250b4f2f899e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.27264","last_updated":"2026-06-27T10:50:32Z","snapshot_observed_at":"2026-08-13T10:23:41.888529Z","submitted_at":"2026-06-25T16:47:05Z","title":"CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T05:40:03.047274Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.27264"},"observation_digest":"sha256:269813433750ae5e2f6dcbf1dec7eb6eb07ff024248cdfc0aa708ba5df57d10d","observation_id":"8a48c267-2168-4d6c-9355-5843f187446e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.27264","last_updated":"2026-06-27T10:50:32Z","snapshot_observed_at":"2026-08-13T10:23:41.888529Z","submitted_at":"2026-06-25T16:47:05Z","title":"CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T09:39:49.120139Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.27264"},"observation_digest":"sha256:3b5febf52f3b059bd9f3a96485063753a718ec52976fa77d1bb98f7468c46063","observation_id":"aaa942f2-5d63-45c0-9d8e-f0ec27d554d8","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-16T00:17:33.785540Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T00:10:34.099488Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.785540Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:aab0532014c413b0145f8ba7828fa5d1411556da6b3a2238d04b1c1a3aad0cd9","observation_id":"e58da99f-15e6-4f75-ae40-28dbe6609a75","resolution":{"observed_at":"2026-08-16T00:17:33.785540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17298/citation-record","integrity":"/paper/2508.17298/integrity","json":"/paper/2508.17298/citation-record.json","paper":"/paper/2508.17298"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.513735Z","title":"A Benchmark for Compositional Visual Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.513735Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:27cb44088866953d584d3437691bde9ac6cb8008fefc2c6176b331e0d8f72206","observation_id":"bf9a193c-382c-40e5-bdc0-23b094869826","resolution":{"observed_at":"2026-08-15T17:09:17.513735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.518180Z","title":"Take A Step Back: Rethinking the Two Stages in Visual Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.518180Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e3c6d3515805aaf1dfb5928317802447e2b6f9af73120b7bf51f4e94170bc4cc","observation_id":"83611022-30e1-43e8-9896-77fd7aa45eae","resolution":{"observed_at":"2026-08-15T17:09:17.518180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.521694Z","title":"The Book of Why: The New Science of Cause and Effect","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.521694Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:47ee7c4617f9c4a041208cdd6f057eed6bd7c54e2574e8405a8206a2b826cfe3","observation_id":"924adcb7-85f5-44d2-b420-1bf109c57bac","resolution":{"observed_at":"2026-08-15T17:09:17.521694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.526199Z","title":"Inferring and Executing Programs for Visual Reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.526199Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:34b2beac42c8cb3a85dc934d029fe0c4fa546b70bb64d6e6bca12c461bc6afb3","observation_id":"5bd42100-d56e-4ac5-a5df-668a858ae1f0","resolution":{"observed_at":"2026-08-15T17:09:17.526199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.530233Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.530233Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:12668595f18a1e8f56b7d874effa760d6337e1379598a3869a3a5d34adc29457","observation_id":"70ba1066-30bf-407e-8f16-35b1c2b99abb","resolution":{"observed_at":"2026-08-15T17:09:17.530233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.533928Z","title":"RA VEN: A Dataset for Relational and Analogical Visual REasoNing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.533928Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:77a841fd08f186b18547e79ce7842a563bccdd95a0696d7b0a09bfeb02f56a57","observation_id":"f44fd22e-c38b-4cdb-a66b-86b7bf678bee","resolution":{"observed_at":"2026-08-15T17:09:17.533928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00840","last_updated":"2017-12-03T21:17:07Z","snapshot_observed_at":"2026-08-14T20:07:27.203500Z","submitted_at":"2017-12-03T21:17:07Z","title":"Visual Explanation by High-Level Abduction: On Answer-Set Programming Driven Reasoning about Moving Objects","version":1},"cited_work":{"arxiv_id":"1712.00840","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00840","snapshot_observed_at":"2026-08-15T17:09:19.570251Z","title":"Visual Explanation by High-Level Abduction: On Answer-Set Programming Driven Reasoning about Moving Objects","venue":"cs.AI","work_id":"f1fac570-9742-4f41-a035-acb07d02f353","year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.538323Z"},"links":{"cited_paper":"/paper/1712.00840","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:71c7f19e0eec4dd361b3078e58594c287223da8921087dae0e55acc1b6fa4e67","observation_id":"bf4e9e29-bbb8-482e-ab01-1cdef4a157c6","resolution":{"observed_at":"2026-08-15T17:09:19.574350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.542217Z","title":"Maintaining Reasoning Consistency in Compositional Visual Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.542217Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:ef1355d4f26adaa53c563047bc11e9be540f695926d0ac36d11408a457155db4","observation_id":"f9d54651-546f-40c1-be8f-cc8b0b4c4ba3","resolution":{"observed_at":"2026-08-15T17:09:17.542217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.545552Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.545552Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:9b238ebd1191ac0816dea94b2709053a269a8c35e8a85a480a4aa1e16e9a7b5d","observation_id":"5f3077c1-cef7-4d19-835a-8a9cc3205176","resolution":{"observed_at":"2026-08-15T17:09:17.545552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T17:09:17.549166Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.549166Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:04092d50d495a9a2e2ab9a23cbd33bca39c2438da3c034edd208491474185e8b","observation_id":"0b3b3d39-4673-414f-84e2-c0fb42fc0b6d","resolution":{"observed_at":"2026-08-15T17:09:17.549166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.553400Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.553400Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:edfd3957382d06a9c2bd6b32b6d25336394ea0bd4f9dd99e7c4e2ac82f00bb5b","observation_id":"719d8d4f-3419-4e9f-ab68-3fc22040ea3e","resolution":{"observed_at":"2026-08-15T17:09:17.553400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.557143Z","title":"InstructBLIP: towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.557143Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:4392bf3c8fbe07ea9684ddbe0d4afb11dbee00aa70b566ca9a4ece74b35c5cd8","observation_id":"9372ac24-3045-4847-a1fa-c748255303ca","resolution":{"observed_at":"2026-08-15T17:09:17.557143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.560723Z","title":"A Survey of Multimodel Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.560723Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a90aad2c51727de0316594757623db0cdc4fa968ba951fe9007615eee77070d2","observation_id":"e174f2f3-7221-4093-849e-c6e360e8dc2d","resolution":{"observed_at":"2026-08-15T17:09:17.560723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.564558Z","title":"Interpretable Visual Reasoning: A Survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.564558Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c0e322bc0db29aa6d167297c47f7bcfe62b43b69c999c158ec1a8a5091b12a8b","observation_id":"6e70e9c5-698a-4ac0-a3df-92b461415d20","resolution":{"observed_at":"2026-08-15T17:09:17.564558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-16T12:50:14.908183Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-15T17:09:17.568659Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.568659Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:aa8579b3942fc5cf9513b19f54de2704142c8daccf812baa87740fcb8dfd8904","observation_id":"e0a07f5f-c192-4958-a691-081a514198a5","resolution":{"observed_at":"2026-08-15T17:09:17.568659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-15T17:09:17.572947Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.572947Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:299645cc17197c9c9de01900fa3d257c1eeaa4593e223b366ff7bcd60e65054e","observation_id":"0e2b5f02-331d-461e-aadf-b9937102a53b","resolution":{"observed_at":"2026-08-15T17:09:17.572947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.576724Z","title":"Position: Prospective of Autonomous Driving - Multimodal LLMs World Models Embodied Intelligence AI Alignment and Mamba","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.576724Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:6cc099c32b8a7ea10112c7c14fd80ffc7a4fbeb8ca05f5eff84eb342a41e17e2","observation_id":"512ec9a5-7708-4f86-bf24-29a0b4fdf499","resolution":{"observed_at":"2026-08-15T17:09:17.576724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10196","last_updated":"2024-09-16T11:42:15Z","snapshot_observed_at":"2026-08-16T13:18:13.732559Z","submitted_at":"2024-09-16T11:42:15Z","title":"NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UAV Search Missions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10196","snapshot_observed_at":"2026-08-15T17:09:17.580278Z","title":"NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UA V Search Missions.arXiv preprint arXiv:2409.10196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.580278Z"},"links":{"cited_paper":"/paper/2409.10196","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:280142fc53676dd9f1862530f2cf8bbae415a4099780fabc1740699c027825e6","observation_id":"815e063b-a98a-4958-ac2d-0ddd06033f11","resolution":{"observed_at":"2026-08-15T17:09:17.580278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.584057Z","title":"UA V-based Urban Structural Damage Assessment Using Object- based Image Analysis and Semantic Reasoning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.584057Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e03d55de7f0226978e0e454b362d9bcc7f1fb68944f91e82ea262385e39f7a66","observation_id":"d43da455-eb95-4631-abf3-20648f47a5c2","resolution":{"observed_at":"2026-08-15T17:09:17.584057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.587663Z","title":"A Study of Visual Reasoning in Medical Diagnosis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.587663Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0d1e8cceabf3aae0a3637dc236fd7a38debf15e5de175c2c814ac71bfb8f68c0","observation_id":"987e6fbc-1c5d-487a-92b8-82eb754d8265","resolution":{"observed_at":"2026-08-15T17:09:17.587663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.590944Z","title":"Medical Visual Question Answering via Conditional Reasoning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.590944Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:40859333243734b9f253dfe0393a5c9ac031ce4f84850d92e698d397b10c26f7","observation_id":"96a9982d-3315-4005-abf4-39a1116d614a","resolution":{"observed_at":"2026-08-15T17:09:17.590944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13826","last_updated":"2023-04-26T20:56:40Z","snapshot_observed_at":"2026-08-16T15:37:25.320775Z","submitted_at":"2023-04-26T20:56:40Z","title":"Programmatically Grounded, Compositionally Generalizable Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13826","snapshot_observed_at":"2026-08-15T17:09:17.594301Z","title":"Programmatically Grounded, Compositionally Generalizable Robotic Manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.594301Z"},"links":{"cited_paper":"/paper/2304.13826","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:112a0c7c589acf9cba2eb86adf2f3933518ea49145baab95c420d93065e15846","observation_id":"79ab4d51-8731-415c-9a36-9f3079477b69","resolution":{"observed_at":"2026-08-15T17:09:17.594301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.598754Z","title":"Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.598754Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e6db415325871ea04c3b710c619b01eb749adf2af62f01e4bea30c6220e54467","observation_id":"33a7b91a-c907-4811-8035-29075a1d6879","resolution":{"observed_at":"2026-08-15T17:09:17.598754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.602375Z","title":"When and Why Vision-Language Models Behave like Bags-Of-Words, and What to Do About It? In The Eleventh International Conference on Learning Representations ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.602375Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:eca60a72f6892aa60988b13f8b30ee8070140ada9e24e4068c06df62ab331b25","observation_id":"297a2486-68bd-44b4-8619-b25f63c90620","resolution":{"observed_at":"2026-08-15T17:09:17.602375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.605883Z","title":"Challenges and Prospects in Vision and Language Research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.605883Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:90eb84b843933642a0213c4917ad87c1ac5d87e1a11e02391590179b558e4546","observation_id":"99030bc0-26ea-4050-a685-58bd8e373122","resolution":{"observed_at":"2026-08-15T17:09:17.605883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-16T17:40:08.900487Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-15T17:09:17.609224Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.609224Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:cec60869e5240b23967b474aa1f489c7b20eab8c5dda05277a622c3bb6f42582","observation_id":"196cf821-1c40-4821-b251-93dbff6c6ea7","resolution":{"observed_at":"2026-08-15T17:09:17.609224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.612998Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.612998Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:f83a46bbb77b7be7291c925f4a2775ccb68254210386a0abc86fd3bf92be6083","observation_id":"2fd5befd-2d65-4ff3-a00c-4e9608088e1a","resolution":{"observed_at":"2026-08-15T17:09:17.612998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.616473Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.616473Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:cff271290af922b7f3f2a87056c246f05fe782e585b4cbce85b634ca6a5ac574","observation_id":"4d087fe7-1755-40e9-98ea-16743f97646e","resolution":{"observed_at":"2026-08-15T17:09:17.616473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.620594Z","title":"HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.620594Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:bc80db70d3dced0b4a8f8f277cce36e7e54cea5f04a1346c37427e64bce0f073","observation_id":"3daeb3fe-c31d-429a-a273-1e2da67a7da6","resolution":{"observed_at":"2026-08-15T17:09:17.620594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.624093Z","title":"Towards Truly Zero-shot Compositional Visual Reasoning with LLMs as Programmers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.624093Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:63ca9bc2f60d57e6db66395144d22e7b40a4c7f107a730240734b44f83748a29","observation_id":"53e0aaa8-566d-42d4-9045-52f301a33acb","resolution":{"observed_at":"2026-08-15T17:09:17.624093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-15T17:09:17.627597Z","title":"Multimodal Chain-of- Thought Reasoning: A Comprehensive Survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.627597Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:60306261c15243b345df2e896d41f76f25dba30bd031531edad1bf2792660a59","observation_id":"b1388ad6-63e2-47fc-baad-db756fcd9eea","resolution":{"observed_at":"2026-08-15T17:09:17.627597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.631786Z","title":"Enhancing Multimodal Compositional Reasoning of Visual Language Models With Generative Negative Mining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.631786Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:ececeaa4e11e64a17af1cdde5d10ca77e2ba4c8f0cd51db72a16433d700ac8f6","observation_id":"8d1ceb2c-3880-4c4f-b55b-82c3818c16cc","resolution":{"observed_at":"2026-08-15T17:09:17.631786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.635381Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.635381Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:567bd603f55f306450dcbdb7fd7d821e36902fb4278f63dd0ed81930d1b55d6c","observation_id":"85856c28-b570-4790-9b5d-f4e1b6ca1e72","resolution":{"observed_at":"2026-08-15T17:09:17.635381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.638828Z","title":"Cascaded Mutual Modulation for Visual Reasoning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.638828Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:8c5a7652517da4ab3a7e57a09efbaa46547962ba59eb0bf9790b0b64415288a2","observation_id":"64d1eec0-1361-4820-ad73-17f8e09fad9b","resolution":{"observed_at":"2026-08-15T17:09:17.638828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.642304Z","title":"Compositional Chain-of-Thought Prompting for Large Mul- timodal Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.642304Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3684d33432a1471b77fb907ae2b3942714cdc2f3225720b8d9b2ea2451207dbe","observation_id":"a2df30ad-5b05-4301-9b66-9afb134bfb95","resolution":{"observed_at":"2026-08-15T17:09:17.642304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.646029Z","title":"Building Machines That Learn and Think Like People","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.646029Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5b01615dbb83b2f8745dc51b1b7d0f4aa24cecef99007e38cc7f57ebf7e69206","observation_id":"d784b18a-9cbd-4deb-90b5-9eda1f65b23a","resolution":{"observed_at":"2026-08-15T17:09:17.646029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.649583Z","title":"Meta Module Network for Compositional Visual Reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.649583Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e273889f929e573da57204caeec1e1d5f1eff31f1c3cc9c09a5e4cc49afbe676","observation_id":"918a7128-311b-4c4c-ad4e-de30c815e0a4","resolution":{"observed_at":"2026-08-15T17:09:17.649583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.653229Z","title":"Improving Visual Reasoning Through Semantic Representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.653229Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:d70146d0871176f70c87759eb163b61372b41b18e6d04b64708e17ff5bff0715","observation_id":"3d198a3e-97a6-4c85-a11e-aa27679b8ef0","resolution":{"observed_at":"2026-08-15T17:09:17.653229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.656988Z","title":"What’s Left? Concept Grounding with Logic-Enhanced Foundation Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.656988Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:6f53568652e911ffe5d448aa8bd6e5b89d4ee263a13ed8da54f2e2339de5fa5f","observation_id":"b25d1405-e144-46fd-ab8e-b15b530a418f","resolution":{"observed_at":"2026-08-15T17:09:17.656988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.660571Z","title":"Visual Question Answering: A Survey of Methods, Datasets, Evaluation, and Challenges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.660571Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a7f0fa1e9381e9c2a2c25b66b1746b4d055b231952620bf9a0835a8569dfe0fa","observation_id":"683be0f2-2665-4239-afec-bcb50526e037","resolution":{"observed_at":"2026-08-15T17:09:17.660571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.664117Z","title":"Visual Question Answering: a State-of-the-Art Review","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.664117Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:90447bddaa08c10121f9e7f933636019328e9f28f6a89c331c6e36cafe1ea634","observation_id":"fc3fc673-c443-42a2-b420-165676db93b1","resolution":{"observed_at":"2026-08-15T17:09:17.664117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.667724Z","title":"Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.667724Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:9673279fa24581de6dc3b80c6842ef0563ef749a869dc9d5fe4d0f964b2c8a15","observation_id":"2d033639-8414-435d-8263-eeebc82ec403","resolution":{"observed_at":"2026-08-15T17:09:17.667724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18071","last_updated":"2025-03-23T13:40:44Z","snapshot_observed_at":"2026-08-16T12:47:36.171272Z","submitted_at":"2025-03-23T13:40:44Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18071","snapshot_observed_at":"2026-08-15T17:09:17.671253Z","title":"Mind with Eyes: from Language Reasoning to Multimodal Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.671253Z"},"links":{"cited_paper":"/paper/2503.18071","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:524e7a2d77efb2177bd093825a1efe20375f0debc3570db4dab880d5a2d4f4ea","observation_id":"e4977987-e095-4c48-8059-9b2636c812a4","resolution":{"observed_at":"2026-08-15T17:09:17.671253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.674787Z","title":"A survey of neurosymbolic visual reasoning with scene graphs and common sense knowledge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.674787Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b35a2c5f61c74f5fb04ccdbfae6ba36e8a124a018539aa4a52312a391488633b","observation_id":"f4ae5747-05cf-4036-bf44-e2481bc8e361","resolution":{"observed_at":"2026-08-15T17:09:17.674787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.678225Z","title":"Deep Learning Methods for Abstract Visual Reasoning: A Survey on Raven’s Progressive Matrices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.678225Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:c5519f9d1c3e8d0b7d97b541bfb46bcf8f2a4172729b8b284c199fc7cbd2ede9","observation_id":"c960d985-fdbd-4ba9-abb0-3c3a02cd2d7c","resolution":{"observed_at":"2026-08-15T17:09:17.678225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-08-16T14:16:00.935473Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-15T17:09:17.681651Z","title":"Large Multimodal Agents: A Survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.681651Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:83d4bf0db1ec6eb7a314fe84c14d90bd69a57d11734bdf22fea3812b38458091","observation_id":"06ab9bbb-a02a-4267-a8bb-86804d9c61db","resolution":{"observed_at":"2026-08-15T17:09:17.681651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.685501Z","title":"From image to language: A critical analysis of Visual Question Answering (VQA) approaches, challenges, and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.685501Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:d8e23f4c0660923eb6f7a51e30954c284e248eaef6e6c291cb8a7ed288b51b52","observation_id":"bbef4951-f830-443c-94dd-8e38f18c843d","resolution":{"observed_at":"2026-08-15T17:09:17.685501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.689858Z","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.689858Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:dd63c56e6594bdcd0f3e4103c79e8bf8adc7020f41b30531df5119403ba0b7c8","observation_id":"1c15a348-49a0-4fee-8ca8-1f237413e057","resolution":{"observed_at":"2026-08-15T17:09:17.689858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-08-15T17:09:17.693163Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models.arXiv preprint arXiv:2505.04921,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.693163Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3c5044cdabd9918bb70c03739a6a1428658ba42787dd0de7c40b47a804d83590","observation_id":"ba5105d8-c291-475e-bc8e-29ac4f2cd677","resolution":{"observed_at":"2026-08-15T17:09:17.693163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.696947Z","title":"How to Bridge the Gap Between Modalities: Survey on Multimodal Large Language Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.696947Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a76bc84a8f3d500e8785154be605a0a1d1faad8998f50251af11eeb7b4f362ce","observation_id":"94d521e2-9d73-4f3e-81d2-107b850daa29","resolution":{"observed_at":"2026-08-15T17:09:17.696947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.700806Z","title":"Tool learning with large language models: a survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.700806Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b85cc6d82cf14521471fbfbf6a9090ec99615c00401bf7b8f5f637b967dbd64f","observation_id":"deb20ad6-fd0f-4386-b1f4-d13d21265ad4","resolution":{"observed_at":"2026-08-15T17:09:17.700806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.704220Z","title":"Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.704220Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:f4d6b6351019f31aad1ec75bd43412598c5c474bd34f9fa61f9d48ecb58230c3","observation_id":"77ab8f79-80a7-451e-8d54-432ec300cc0d","resolution":{"observed_at":"2026-08-15T17:09:17.704220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.707897Z","title":"Multimodal Intelligence: Representation Learning, Information Fusion, and Applications","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.707897Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:47fc91c0bee53f49e359a6e3119d0a8d0183637ae27ba06b24074ea30513be66","observation_id":"02920ede-5fbd-4de5-b835-f6a418c41248","resolution":{"observed_at":"2026-08-15T17:09:17.707897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.712111Z","title":"Transformation Driven Visual Reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.712111Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:59767d1923c5c6d226b51841b4c81dda4d6132de9939704e1350e35399e19574","observation_id":"2f2659f7-bea5-4572-afa9-8c2b0efb2b45","resolution":{"observed_at":"2026-08-15T17:09:17.712111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.716819Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.716819Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b09f2879c49a1fc6cc28dd36ce4ed4a27a59788eff915905fbdbf561dac5609b","observation_id":"1b81e6d5-89b6-45c5-b512-b315b8302a38","resolution":{"observed_at":"2026-08-15T17:09:17.716819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.720344Z","title":"Two-stage Rule-induction visual reasoning on RPMs with an application to video prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.720344Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:703fdf85b4a43ba3788188b1d72c3839ca2bfb2d9248fe37915251673db01d30","observation_id":"b1010c49-1a83-43c7-bccc-18c96da62785","resolution":{"observed_at":"2026-08-15T17:09:17.720344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.724028Z","title":"Hierarchical ConViT with Attention-Based Relational Reasoner for Visual Analogical Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.724028Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:438b82ee958c6f26bf7990093f1853922cca70be4fc54ba992172ed35ee4f72c","observation_id":"ca4d0ffc-6df0-41e3-ab35-cf09a055772c","resolution":{"observed_at":"2026-08-15T17:09:17.724028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.727468Z","title":"You Only Look Once: Unified, Real-Time Object Detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.727468Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a3761e2ec8839b19eb56057b67a18d5d52dbbc7d55eb184412bb32a2a86d313a","observation_id":"90671fdd-138e-4c0c-9b78-b6022419b97b","resolution":{"observed_at":"2026-08-15T17:09:17.727468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.730761Z","title":"Multi-Modal Factorized Bilinear Pooling With Co-Attention Learning for Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.730761Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:79fa0656d0082e4bbdc33fbda7eb98beb44c84257a7f12196efb893c251dd2eb","observation_id":"688bf382-7594-46c3-b2a0-26b482a034c4","resolution":{"observed_at":"2026-08-15T17:09:17.730761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.734056Z","title":"Bilinear Attention Networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.734056Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:fa644220d9b5b8ae31faba179c30a1b87a98bcc0a0e9ce6ebfa0ac8d793d957e","observation_id":"8dde71b0-5067-4b54-af20-57d9a50dc076","resolution":{"observed_at":"2026-08-15T17:09:17.734056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.737492Z","title":"Improved Fusion of Visual and Language Representations by Dense Symmetric Co- Attention for Visual Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.737492Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:735ed04603cfc01e2fb8fddeedd3a05f7c684f65723bef5bd0c3dd24a1a537b1","observation_id":"941cd9c1-6dfe-4474-9d73-c0242e7b12d4","resolution":{"observed_at":"2026-08-15T17:09:17.737492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.741248Z","title":"Deep Modular Co-Attention Networks for Visual Question Answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.741248Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a42e339bd99c26b1dbf801b163ab39ef12b96b4fc8c54b71d88390d3d69953ed","observation_id":"062c41e1-e85c-4bc4-bd55-c6aedc3761e8","resolution":{"observed_at":"2026-08-15T17:09:17.741248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.745210Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.745210Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:73d9c903715d0c21e95883c39ecafcbbcaedfafef2fa6231eecfae8e10f4df12","observation_id":"a0c7384f-0162-4842-a675-56c7f7180120","resolution":{"observed_at":"2026-08-15T17:09:17.745210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.748896Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.748896Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:a44e62b1c7dcdbc632620d04ccec277b6b4c9f1d4999446e5087260ac2154901","observation_id":"a2a5f4f7-200d-47c1-959f-5b217f210384","resolution":{"observed_at":"2026-08-15T17:09:17.748896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.752421Z","title":"UNITER: UNiversal Image-TExt Representation Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.752421Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:1f5e2ae165bdf70afe128003cce3ebd2c67d50c2ad3002bfb727c49d7f0e0468","observation_id":"b4ac0030-bd44-4619-9630-5854e783e3f8","resolution":{"observed_at":"2026-08-15T17:09:17.752421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.756195Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.756195Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:279f1b4f43353fad87a4d5b2f585f658f0f02c9e5acb0591bf0398da6841daca","observation_id":"55445a2a-d4e0-4e52-b950-feee7d366620","resolution":{"observed_at":"2026-08-15T17:09:17.756195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.759948Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.759948Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0d5c3703540db98b0d2204640246cc5520d43b43358c75e08f8005602891b881","observation_id":"57c32c0e-3d8e-406c-be76-bceed02b541c","resolution":{"observed_at":"2026-08-15T17:09:17.759948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.763717Z","title":"Otter: A Multi-Modal Model With In-Context Instruction Tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.763717Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b8eb91e121c58ab4bd805f89d513f6f3c8a51d1f1323d19f3bd84e97fad4f2c4","observation_id":"2b23ce4f-6699-4b99-8f80-0196f07275b9","resolution":{"observed_at":"2026-08-15T17:09:17.763717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.767580Z","title":"CREPE: Can Vision-Language Founda- tion Models Reason Compositionally? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10910–10921, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.767580Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:87bed41fd47f7e54bc7951e0608dd8effc5f682f3e965b76faad13a03448c331","observation_id":"f7ed05ab-d852-437c-b3cd-3ff03a1c8f2a","resolution":{"observed_at":"2026-08-15T17:09:17.767580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.771070Z","title":"Logics and Languages","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.771070Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:051e1e0061c0e29add9708b2c9822baca40067785b792e4f8454fef6826f208f","observation_id":"84fb288c-bba1-47aa-91a0-ddd47bc24e45","resolution":{"observed_at":"2026-08-15T17:09:17.771070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.775107Z","title":"From Recognition to Cognition: Visual Commonsense Reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.775107Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:029f5d77ee467756855b4fb4279fa6d1d55bab64847f5534496036e0ea0e7bd3","observation_id":"f4ad16d1-0bed-4eee-960b-6027a2807b91","resolution":{"observed_at":"2026-08-15T17:09:17.775107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.778592Z","title":"Visual Programming: Compositional Visual Reasoning without Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.778592Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:937f8dea9991398c4d482c806763aea8541e2c6b0bdef940e7f5399500c94c81","observation_id":"baf19ec6-f9e9-43a4-bb37-7391120e77c8","resolution":{"observed_at":"2026-08-15T17:09:17.778592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.782737Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.782737Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0149c101faf0b6982a5528da23ed3bafb8e83f937e50bd39b01cbf57302a6e3c","observation_id":"99f6c90f-0741-4e80-bb46-f36ffe1334c4","resolution":{"observed_at":"2026-08-15T17:09:17.782737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.786176Z","title":"Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.786176Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:09f70251d16e038828a5017ed4a4391654974f77ab1459792450abf307216802","observation_id":"2bc9b9a0-95bb-4356-8361-fd0d53e5ac2c","resolution":{"observed_at":"2026-08-15T17:09:17.786176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.789732Z","title":"Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.789732Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:cd724f1a2cc222747c89674345926c2bd6db59377ecc9e40a27972b9ea0f31d0","observation_id":"42dac3b9-737c-4faa-9eaa-dd61249f1bd7","resolution":{"observed_at":"2026-08-15T17:09:17.789732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.793148Z","title":"DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.793148Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:90682c8c05d55b4a090923efd6108a3d072c6de96c0c2118af64ea65ea444b4f","observation_id":"1e1b648b-eb9d-4cd7-a375-5885712aef3d","resolution":{"observed_at":"2026-08-15T17:09:17.793148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.796395Z","title":"Iterated Learning Improves Compositionality in Large Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.796395Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:1a7262f40ee2425d1c861141ff6f14121732a5844f9b8896cfb738f98d5ba8b4","observation_id":"219d2711-261d-4c2a-8821-b4e16c67407e","resolution":{"observed_at":"2026-08-15T17:09:17.796395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15436","snapshot_observed_at":"2026-08-15T17:09:17.799892Z","title":"Chain-of-Focus: Adaptive Visual Search and Zooming for Multimodal Reasoning via RL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.799892Z"},"links":{"cited_paper":"/paper/2505.15436","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:904e941e41fc94e9bec208fe4f6e13b40c875da074a26a531557157cd4ebfea5","observation_id":"0be00509-5529-45a1-9744-ea2ffe4877ee","resolution":{"observed_at":"2026-08-15T17:09:17.799892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.804131Z","title":"Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.804131Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:fd043c0155a143e92ad48e6958e13fa33ddb75d265de6560dc80c70a392a936d","observation_id":"402ae171-e88e-405b-8586-0d8f42ab9c48","resolution":{"observed_at":"2026-08-15T17:09:17.804131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.807533Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.807533Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:e2eb9e9f1bb1af1d116ea42d2512d83d4631c924441d708b6aa832a8f4138b90","observation_id":"fd81ad9a-57cb-4db9-a2e5-1c4001c63617","resolution":{"observed_at":"2026-08-15T17:09:17.807533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.810619Z","title":"Visual Compositional Learning for Human-Object Interaction Detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.810619Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:1d2549a49365756374df4072b480c4cc715a39b79266e3df839a0d28f0c1cb20","observation_id":"5003c3c9-2241-4807-bf99-040ceabd0e34","resolution":{"observed_at":"2026-08-15T17:09:17.810619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.814504Z","title":"Learn- ing Visual Composition through Improved Semantic Guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.814504Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:bcdecf7fce27d8f30e5fc9d40a4e47aef5d21401cacc91c8d62a2c8380210fd5","observation_id":"768452f4-e668-425f-9073-9215c305e181","resolution":{"observed_at":"2026-08-15T17:09:17.814504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.817979Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Lan- guage","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.817979Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:62281158ebd39d7c3af839216d50fdba79abddd525223e07d2d566f35070543a","observation_id":"192f2e11-89cd-4f08-a990-e135ce90ee3a","resolution":{"observed_at":"2026-08-15T17:09:17.817979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.821769Z","title":"Synthetic Visual Genome: Dense Scene Graphs at Scale with Multimodal Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.821769Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:6ca93b36a48b2589980c9b5f9ca0f4705258c97cb230bafabdb4432bfb2355f1","observation_id":"8930522c-42f9-4904-9d26-9b80d0fa34ba","resolution":{"observed_at":"2026-08-15T17:09:17.821769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19322","last_updated":"2024-06-18T05:57:14Z","snapshot_observed_at":"2026-08-16T14:05:34.392285Z","submitted_at":"2024-03-28T11:26:30Z","title":"Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19322","snapshot_observed_at":"2026-08-15T17:09:17.825678Z","title":"Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.825678Z"},"links":{"cited_paper":"/paper/2403.19322","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:bb529679b0f5bd5618abd25fdae7aac3bd5d0d99bddc1c5d74b71856941664da","observation_id":"987437d3-de0a-4659-b914-f0228fce6e58","resolution":{"observed_at":"2026-08-15T17:09:17.825678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.829651Z","title":"DisCo: Improving Compositional Generalization in Visual Reasoning through Distribution Coverage","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.829651Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:fa9de2238b7d960808b0d84d91c745ef124aed75d97b7fd734f952eeaadce5ba","observation_id":"278a00d6-4fee-4601-8e17-672634a531d7","resolution":{"observed_at":"2026-08-15T17:09:17.829651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.833925Z","title":"Divide and Conquer: Answering Questions With Object Factorization and Compositional Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.833925Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5489b660bc706e7f01da00e550642add88476b2964c78538c3505839c62192a2","observation_id":"29a18e16-e797-45cb-9f18-3830955ce0c2","resolution":{"observed_at":"2026-08-15T17:09:17.833925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.837525Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.837525Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:7452a15edd8869b4a5f20cec5be4612e41096f10c4c4a14b36970f460069be5b","observation_id":"b9db1b69-797a-4db1-95d2-c85d21c96437","resolution":{"observed_at":"2026-08-15T17:09:17.837525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.840955Z","title":"Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.840955Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:5cd8a868cca647e7f9e9ff60cfad931278eba87f988d7a01a2aae45f40f9aafa","observation_id":"f2878906-a8f7-4076-99eb-00848f53b154","resolution":{"observed_at":"2026-08-15T17:09:17.840955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.844636Z","title":"From the Least to the Most: Building a Plug-and-Play Visual Reasoner via Data Synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.844636Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:0892f447a477aaf4d207b3ec521cd66da88ed1c0596649fe1817dae0cab5d188","observation_id":"9da7e67f-463c-45f7-bad2-459093ead803","resolution":{"observed_at":"2026-08-15T17:09:17.844636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-16T16:52:49.240000Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-15T17:09:17.848322Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.848322Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:53b06e1b0bd890002d4324f0a8aabe324894f4943f767cc56092d06cfd0966fe","observation_id":"604da5ec-4610-4637-958d-0ea41dd807fb","resolution":{"observed_at":"2026-08-15T17:09:17.848322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-08-16T13:50:31.641345Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-08-15T17:09:17.852321Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.852321Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b2dccfc9ba1a10292c283733bac2ddd10670eb5e6a22bf4048526379d813a978","observation_id":"61c5613e-7010-4d73-8542-7ce9f4cea9a7","resolution":{"observed_at":"2026-08-15T17:09:17.852321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-15T17:09:17.857411Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.857411Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:56f40c3290274bb616288ff199ec007a5e1790911f8a21b50049ef2d830c8efb","observation_id":"fb4e0f90-1e84-4ef2-953a-0144669a021b","resolution":{"observed_at":"2026-08-15T17:09:17.857411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-16T12:49:29.988082Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-15T17:09:17.861449Z","title":"Grounded Chain-of- Thought for Multimodal Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.861449Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:fc22c97072c5a0cb4b5334813dca9b1d7c8f05c198646a0b812c4d7b9c8e2fd5","observation_id":"a50aad1e-035b-4fc0-94c0-b621b2a5082a","resolution":{"observed_at":"2026-08-15T17:09:17.861449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.865349Z","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.865349Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:99304175c8ee013c7beb6caa18d779aa0bf257c66c48aeaeab21a66de2a7de19","observation_id":"cd5e1b7d-bb3d-48b5-9f69-0480c2afb333","resolution":{"observed_at":"2026-08-15T17:09:17.865349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.868949Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.868949Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:44adbb026ea60ff45a68b2647216d903b7ad2be1e0c9427e20220bd91fbf3f40","observation_id":"4b9dacbf-46aa-4491-8e98-36ae4e4777fe","resolution":{"observed_at":"2026-08-15T17:09:17.868949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.872314Z","title":"ConceptMix: A Compositional Image Generation Benchmark with Controllable Difficulty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.872314Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:bdf42bc56efe54ba27518adfaffaa793adfc7d6641ba917fc39f3ac62a20ac5f","observation_id":"e37c4b36-3475-43e2-af63-4f2ab3164986","resolution":{"observed_at":"2026-08-15T17:09:17.872314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.875627Z","title":"Visual Reasoning by Progressive Module Networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.875627Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:299548b9b0bd697d37acc11d7cecb5b2033e121df0fe9c5f5e31078c299cfb11","observation_id":"bb85a1dc-0e06-459c-8797-1cbb510a0bbb","resolution":{"observed_at":"2026-08-15T17:09:17.875627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12481","last_updated":"2025-02-18T03:08:37Z","snapshot_observed_at":"2026-08-16T12:57:29.591774Z","submitted_at":"2025-02-18T03:08:37Z","title":"Predicate Hierarchies Improve Few-Shot State Classification","version":1},"cited_work":{"arxiv_id":"2502.12481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.12481","snapshot_observed_at":"2026-08-15T17:09:19.338061Z","title":"Predicate Hierarchies Improve Few-Shot State Classification","venue":"cs.CV","work_id":"25c7517b-489b-41da-a269-31a9bd5c2dfa","year":2025},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.878832Z"},"links":{"cited_paper":"/paper/2502.12481","citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:b63e904c922d08b41b2fcc80c938106900a5d95b613a501a59d4da1ae6778784","observation_id":"b1c5f0c2-31fa-45fc-8e88-0d21b6eb56a9","resolution":{"observed_at":"2026-08-15T17:09:19.342455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:09:17.882743Z","title":"Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T17:09:17.882743Z"},"links":{"citing_paper":"/paper/2508.17298"},"observation_digest":"sha256:3f4313359b78921543528a7b1ae3264bb1a08c476f90f8fcc05d9ce62e354fa4","observation_id":"bf64629d-8068-4973-8e84-c06fc4d03311","resolution":{"observed_at":"2026-08-15T17:09:17.882743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:03:59.832829Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":266},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 266 outbound references and 18 inbound Pith citation observations for arXiv:2508.17298."}