{"as_of":"2026-08-09T08:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4dbae5ba7e6fc565c5277f05a8228e85e9823b3ffc65ba74e0ddeaa69a325c77","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:50.572037Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23045/citation-record","integrity":"/paper/2505.23045/integrity","json":"/paper/2505.23045/citation-record.json","paper":"/paper/2505.23045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:55.206976Z","title":"Robust visual rea- soning via language guided neural module networks","venue":null,"work_id":"9c3c5722-d634-4bac-9a94-c895a4d0de65","year":2021},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.268997Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:abb55e36551533720329367524a189a705ad44f5a9acdab3606af5da6b6b0388","observation_id":"b18421b8-bae5-4053-9afc-8cb321e7af05","resolution":{"observed_at":"2026-08-07T12:59:55.251531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:59:47.776858Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.776858Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:0c3fefcd8cedfca262999659198f5b3649a7bc49f50f945ca3a623b02af4e1e4","observation_id":"c0bd8e5b-352e-47f5-a67e-68d015b84a34","resolution":{"observed_at":"2026-08-07T12:59:47.776858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:54.138496Z","title":"The paradox of the compositionality of natural language: A neural machine translation case study","venue":null,"work_id":"157e21db-2448-4f6f-b6af-ecff9c8480ad","year":2022},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.284091Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:0b8835944e561d578b21b2cb30ffd9d0def8a2a72ad4dd0150c88c4891df4191","observation_id":"b4a17059-f47e-4e7b-9d6a-569fd1894cda","resolution":{"observed_at":"2026-08-07T12:59:54.236317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:53.496310Z","title":"Compositional attention networks for machine reasoning","venue":null,"work_id":"75462ac2-480c-49c8-a889-bdfe0f820b98","year":2018},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.798804Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:643db95a98f207f98b40f4c2e223b5d0f33209dbbe6f70581acc810c66ec8704","observation_id":"8940b1cd-16e3-4832-ba82-3ad6cfdb8cb6","resolution":{"observed_at":"2026-08-07T12:59:53.562432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:53.322077Z","title":"Gqa: A new dataset for real-world vi- sual reasoning and compositional question answering","venue":null,"work_id":"edd309bd-4ac6-420a-b3da-d61cb8bf5b53","year":2019},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.912036Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:c7122689d653569ce6e01c3a025ff016be8cb3004bd4bfee1f9d5ebcb0b22e62","observation_id":"d3fdc2e3-c1cf-452e-aaf6-3180e7314be8","resolution":{"observed_at":"2026-08-07T12:59:53.412975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:53.163312Z","title":"Overcoming language pri- ors in vqa via decomposed linguistic representations","venue":null,"work_id":"e2aca92d-cf01-4a13-9cb5-1bda253824af","year":2020},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.026408Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:e3e45c3e3a7006cf8309658307ef94d1600a1af94441908908c87e446bda41c8","observation_id":"c4eeb001-8e61-4eb1-b42a-54a8daf4f156","resolution":{"observed_at":"2026-08-07T12:59:53.224012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.839757Z","title":"On compositional generalization of neural ma- chine translation","venue":null,"work_id":"c8615552-0c8f-4a4f-b260-aba6c3bf8e36","year":2021},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.312110Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:bc95ab3153ab199b0d35ff69fefd4f36b663b47c8e49d6b225a94120e481f056","observation_id":"429d72f8-49df-476c-b1c1-620e3924c0a1","resolution":{"observed_at":"2026-08-07T12:59:52.930710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.624552Z","title":"Compositional temporal ground- ing with structured variational cross-graph correspondence learning","venue":null,"work_id":"5e6d8d75-e179-4aa3-8727-4eef6fa68fc2","year":2022},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.459425Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:fe7a7e12ff10a173e332cde2588920447ecc61b3b370cc3f57b5b9531e93c20c","observation_id":"e0913540-94e4-4ec0-8459-a5a7560ddbf9","resolution":{"observed_at":"2026-08-07T12:59:52.702855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T12:59:49.583802Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.583802Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:66d26aab3e127d75b7106b80dce2f8f240024b08b190a9af75fc987e2581d2a8","observation_id":"eb087c05-4a06-4060-9124-558dca9fa6e8","resolution":{"observed_at":"2026-08-07T12:59:49.583802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.405966Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"1ec7708b-874e-49a4-a374-7354940c47eb","year":2023},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.700193Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:be3d5c33d74745ad8114fce9490baab30edf96f48c3015a5c1e2e5973fd124db","observation_id":"609bb895-7b91-4415-bb51-01fc2ece2c4d","resolution":{"observed_at":"2026-08-07T12:59:52.492842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.261891Z","title":"Overcoming language priors in visual question answering with cumulative learning strategy.Neurocom- puting, 608:128419,","venue":null,"work_id":"b3eff3c3-7094-4d49-8bfc-5c1467b0b551","year":2024},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.804989Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:6a13e720727eab551bb44aa04d7fd9ba8c17f13d0ae2c0dcd582e2ba6bb1980c","observation_id":"1be7d0da-f113-40fc-8fcd-6961a2a70cac","resolution":{"observed_at":"2026-08-07T12:59:52.339922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.083718Z","title":"Learning graph embeddings for compositional zero-shot learning","venue":null,"work_id":"aa63c25e-3b12-4406-9b3c-91d8056aa63f","year":2021},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.904424Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:54f5e1dea53d7ca2823e8a90538744fac249e025fdaf08fa65446e1e52603524","observation_id":"8451fc69-76bf-430f-9820-732a71aa2046","resolution":{"observed_at":"2026-08-07T12:59:52.201847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.916534Z","title":"Coarse- to-fine reasoning for visual question answering","venue":null,"work_id":"e5aa6238-99a6-4d17-9fca-73a3c847fd74","year":2022},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.983404Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:ae7c9b08799ce94a56d4556849f97f5f9b0d82ee5adfe438c11634354f1fdd36","observation_id":"5013e0f5-cae0-438c-aad6-ab0b066194e8","resolution":{"observed_at":"2026-08-07T12:59:51.989430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.693195Z","title":"Counter- factual vqa: A cause-effect look at language bias","venue":null,"work_id":"9afcbd35-c921-4385-b23a-bfc67bd4b8d0","year":2021},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.085036Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:dd7c6a0a6dd1737da6378fee31a2c39f84e07dd43e851c43a724324fb6d7ec3c","observation_id":"2f69b773-4bc7-4254-aada-d63274af7adf","resolution":{"observed_at":"2026-08-07T12:59:51.807706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.440613Z","title":"Combine to describe: Evaluating compositional generalization in image captioning","venue":null,"work_id":"5bb0b77e-fcd3-4df7-93d8-787b88e5e3d6","year":2022},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.199695Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:9d1f80e187ac82aa9d0cd828f281137d973785f45cc69cea678c20d670c7c966","observation_id":"3ff5b3af-7a32-4a3e-a752-e55294efe0bf","resolution":{"observed_at":"2026-08-07T12:59:51.535095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.283436Z","title":"Overcom- ing language priors for visual question answering based on knowledge distillation","venue":null,"work_id":"9edf39ad-2037-4fae-bbd3-e0e5f9d2d16e","year":2024},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.292955Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:721525bdcf628a959dc4b1f9604a4a91d26e5f484e171ffc94c866629516a5d3","observation_id":"5f597684-cc11-4a2a-966a-ae8ae354ffb1","resolution":{"observed_at":"2026-08-07T12:59:51.371537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.099988Z","title":"Faster r-cnn: Towards real-time ob- ject detection with region proposal networks.IEEE Trans- actions on Pattern Analysis and Machine Intelligence (T- PAMI), 39(6):1137–1149,","venue":null,"work_id":"522bc88b-7a58-4604-88c5-64a3e5ccbc78","year":2016},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.359521Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:6b3c41656bd847c1c4100cfe6feb50444ca6c012e72b95cd0ce3b612673ecef5","observation_id":"5e669762-a664-4ace-b641-ec6ef45f7009","resolution":{"observed_at":"2026-08-07T12:59:51.205858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.754062Z","title":"Transformer module networks for systematic generaliza- tion in visual question answering.IEEE Transactions on Pattern Analysis and Machine Intelligence,","venue":null,"work_id":"0b2da87c-cc15-4b88-a44a-c339065f3943","year":2024},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.467823Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:767775e38ba24a24ebe39aeb50b221cfcc0dd6b1a22177cdbee329b2f2889ac4","observation_id":"4504748f-f741-42fa-bbde-df652f9351cd","resolution":{"observed_at":"2026-08-07T12:59:50.800820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:59:50.572037Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large lan- guage models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.572037Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:115ab5d68e885c68d3e79cc91d010659d1d0ec139674dfa424f9f501ff94b403","observation_id":"693b9520-dbfa-4d01-87b8-5a79b1334760","resolution":{"observed_at":"2026-08-07T12:59:50.572037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:54.447423Z","title":"Composi- tional generalization for multi-label text classification: A data-augmentation approach","venue":null,"work_id":"9e7940c8-81fa-4d4e-869d-649cf6c78676","year":2024},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.014768Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:fefcf11b7efabbdbfe07ba5f9ae9194ba256b1c5665291074cbbf1bb25b72d7f","observation_id":"e97128ac-6ca4-48bd-a616-18c832186732","resolution":{"observed_at":"2026-08-07T12:59:54.603085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12889","last_updated":"2019-04-21T15:37:46Z","snapshot_observed_at":"2026-08-02T10:43:43.472315Z","submitted_at":"2018-11-30T17:01:28Z","title":"Systematic Generalization: What Is Required and Can It Be Learned?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12889","snapshot_observed_at":"2026-08-07T12:59:47.666813Z","title":"Systematic generalization: what is required and can it be learned?arXiv preprint arXiv:1811.12889,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.666813Z"},"links":{"cited_paper":"/paper/1811.12889","citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:e0e8d439d313ccbfa47c9565807f80a07760e86069cc259b60339e9c3c521403","observation_id":"aae0f6d1-b5d3-4cf8-a230-5e53e985613f","resolution":{"observed_at":"2026-08-07T12:59:47.666813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.871248Z","title":"Plug-and- play vqa: Zero-shot vqa by conjoining large pretrained models with zero training","venue":null,"work_id":"5e11a6ef-b180-441a-baa0-c45b7eb9b10f","year":2022},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:50.395299Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:93fa34614a335234d7d582be9307864ac4b976b821934ed8a6c1cb1634af0a06","observation_id":"20bd31ab-51f2-4100-aaf3-e99e238a3cfc","resolution":{"observed_at":"2026-08-07T12:59:50.956447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:53.796445Z","title":"Language-conditioned graph networks for relational reasoning","venue":null,"work_id":"97b75ff8-4a6c-47c7-923a-bf0db9f42b38","year":2019},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.556333Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:2a80a837c18b85edb5105816eebb5a14eb87596dcba5c47d1c000ef8f48d72f3","observation_id":"57b6876b-fe2b-4f18-b8f6-9f2eb38fc97d","resolution":{"observed_at":"2026-08-07T12:59:53.872942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:54.879666Z","title":"Vqa: Visual question answering","venue":null,"work_id":"67ae5c2a-0ec4-40d3-82b2-f413a75b87de","year":2015},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.507150Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:4fcca86f5653ceb9c565ab6a9d46475fcf49f642b7a9c2e4375a44a57af6a14e","observation_id":"9fad416c-f1fa-41a0-94ad-5b92de48b6c4","resolution":{"observed_at":"2026-08-07T12:59:54.987320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:53.622993Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"cfdce0eb-3445-4d2d-9dcf-3a2c8c64d9a1","year":2022},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.647648Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:64172ee9404f93508587bec1a4c8d2c0fca038b742b6486e963b3e7e54ebfe59","observation_id":"75cbd23e-776f-4e65-8421-0d99ae9fbce9","resolution":{"observed_at":"2026-08-07T12:59:53.700888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.996213Z","title":"Retrieval-augmented primitive representa- tions for compositional zero-shot learning","venue":null,"work_id":"3d315d90-96a6-4a37-9e31-a4058d8de9d7","year":2024},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.168836Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:2c6becf8a225da9a8cd6b61f4340f6b577b5d55f4558df6bc5985eb66cd3fa6d","observation_id":"48fe8c11-38a7-435c-83d9-612be10ca19a","resolution":{"observed_at":"2026-08-07T12:59:53.082479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:55.096801Z","title":"Bottom-up and top-down attention for im- age captioning and visual question answering","venue":null,"work_id":"aa5fcb44-c900-4c42-aa6a-42d0e9c74264","year":2018},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.360429Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:73951d40670e4e135278ea46ec4c98610d980f379b1c0e5d0bb58ddedd0824ed","observation_id":"4d615ff1-d4ad-49bf-80a8-cb9ff6f181f5","resolution":{"observed_at":"2026-08-07T12:59:55.146044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:53.934775Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"3eb9bf71-cdb3-4af4-88b8-6538895c082f","year":2017},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.421701Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:a5e308a1abc7d8ae1df0b528f1ba0422b66eb29d8e82c261c3060349d95a372f","observation_id":"76936dd3-aa10-40ab-86d3-787576274996","resolution":{"observed_at":"2026-08-07T12:59:54.024402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:54.724849Z","title":"” O’Reilly Media, Inc.”,","venue":null,"work_id":"71ddf004-b2c4-4fae-bb4f-cec60a186a00","year":2009},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.877093Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:331ce85e2d819eac0af0c38740ec81768e2ebc8b76c57311381214e04e2362f6","observation_id":"f68d00ab-f7aa-4635-8185-ce5b4f722839","resolution":{"observed_at":"2026-08-07T12:59:54.785548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:54.334601Z","title":"Meta module network for compositional visual reasoning","venue":null,"work_id":"dc75b3a0-ae24-498a-a2c7-fc739c36b800","year":2021},"citing_paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.112006Z"},"links":{"citing_paper":"/paper/2505.23045"},"observation_digest":"sha256:175db1af2ac3486320d1a350cfcb7178638f74694adf9892321c181b241c7b1e","observation_id":"29fe08f9-f844-4184-b745-8224b9f0eac0","resolution":{"observed_at":"2026-08-07T12:59:54.388196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23045","last_updated":"2025-05-29T03:41:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:29:14.539362Z","submitted_at":"2025-05-29T03:41:36Z","title":"Multi-Sourced Compositional Generalization in Visual Question Answering"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2505.23045."}