{"as_of":"2026-08-16T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba04da54be6aaa02ab0a0dc567fbee46f7b1b19092ab3beee9ed864a88f100ef","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:10:20.537125Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08084/citation-record","integrity":"/paper/2505.08084/integrity","json":"/paper/2505.08084/citation-record.json","paper":"/paper/2505.08084"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:10:20.239076Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.239076Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:6e57faea140fed1d439799da8f2cb77d0e80207c94d8d80df725bb61775c3c45","observation_id":"c8d57195-3bbb-4101-9a88-404d38b7388c","resolution":{"observed_at":"2026-08-15T22:10:20.239076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T22:10:20.244796Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.244796Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:9ccc15e152cf85e21c06c801b020521c61bde10c02199ab31433623a57672d12","observation_id":"b18430cf-a088-42ea-bee7-70789ea7f3a9","resolution":{"observed_at":"2026-08-15T22:10:20.244796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T22:10:20.249973Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.249973Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:c282243af4d33e85bd58810fb5df05409ea86ade366b84505cfde60f6289b71c","observation_id":"51d7f70d-9620-4b87-a3bf-1b386f67adb4","resolution":{"observed_at":"2026-08-15T22:10:20.249973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T22:10:20.255873Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.255873Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:e62d984c7269ee42e3302adcf797be1c39197bfed3ca6a112ab96fb36cbbd70d","observation_id":"095b047a-0e4d-4f62-933f-5456fd8b3a0d","resolution":{"observed_at":"2026-08-15T22:10:20.255873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.260923Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.260923Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:07698679efe5c5486fe3fdcbf4dde49ed3d63025f70d132bbd5f088a4e4956b6","observation_id":"130b10ec-0287-4829-85c5-c75def6851eb","resolution":{"observed_at":"2026-08-15T22:10:20.260923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.494889Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"6bebca37-40ec-4c54-9f67-ce30687ef243","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.265480Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:8c37cfc140737a7371deab2febece8c8d3dfd7338d5ab5eb953121f3ceb4e1f4","observation_id":"12394637-78d5-44ce-a0c1-3a8e0f1b3c67","resolution":{"observed_at":"2026-08-15T22:10:21.500334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-14T01:28:00.438542Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-15T22:10:20.270682Z","title":"Insight-v: Ex- ploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.270682Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:a1b25645d87e33df0c45ca88e7b09844871683ee25fc98f2f87dac7458e5e8b5","observation_id":"52258c8f-1b57-4fe1-a1d4-17e319040724","resolution":{"observed_at":"2026-08-15T22:10:20.270682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.479757Z","title":"Cric: A vqa dataset for compositional reasoning on vision and commonsense","venue":null,"work_id":"4b321ddd-bb6c-48af-bbdd-994359271021","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.275366Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:dd05bc5195c649b66deb484d3654a2fec3b8a9539cde8a35b84218a88f0a473e","observation_id":"c8acdc8e-a4f6-4348-861c-9478d3f69d88","resolution":{"observed_at":"2026-08-15T22:10:21.484735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06212","last_updated":"2024-04-09T11:00:19Z","snapshot_observed_at":"2026-08-13T00:34:17.105182Z","submitted_at":"2024-04-09T11:00:19Z","title":"OmniFusion Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06212","snapshot_observed_at":"2026-08-15T22:10:20.279770Z","title":"Omnifusion technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.279770Z"},"links":{"cited_paper":"/paper/2404.06212","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:e6def2770073772cd46fe805bef59483565b1c3e63d1ea1895a4da1b2b746dd1","observation_id":"022bf1e4-0d4c-41d4-8e49-8103c27707cf","resolution":{"observed_at":"2026-08-15T22:10:20.279770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.464122Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"80e73a3b-218d-4db9-963a-72f9d14888a0","year":2017},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.284387Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:00b931fee397a42c8fe4da0d92f7e3bdb721a62f6d82d5962f2dc037fc44cb6d","observation_id":"d6fe1352-bf80-47a9-ad02-1d5ff373d2f8","resolution":{"observed_at":"2026-08-15T22:10:21.469059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.450560Z","title":"Visual pro- gramming: Compositional visual reasoning without training","venue":null,"work_id":"eb34f519-aa40-43cd-8038-6cc3d4523b15","year":2022},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.289765Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:4c12dc913728c69cbf6d799b862244f47e0ba26b6fc41c836366e2c1d14ba068","observation_id":"d6104dc0-7c3e-4659-81d1-acfa488dd8be","resolution":{"observed_at":"2026-08-15T22:10:21.454740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.435962Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":"0b70d802-6c3a-4afe-84d4-7cab98b5bf3e","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.294585Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:fdc30882d31e2b0f250060afd8e002d1a4105bfcfdb2119ec6827c4f9709a79f","observation_id":"415be4a6-2aea-444b-ba2e-fa79b0e12c3a","resolution":{"observed_at":"2026-08-15T22:10:21.440595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.420071Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"68c3d39c-42ea-4a46-a1e0-58ab82d5bf1e","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.299056Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:3f506f799c9cde2043b344fbda1729d3a2925c0b23f821c5534b8f1de28e2bc1","observation_id":"1d3a3e97-46a7-4e47-a07e-74cf9850c2dd","resolution":{"observed_at":"2026-08-15T22:10:21.424498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.405221Z","title":"Hudson and Christopher D","venue":null,"work_id":"568cf651-acd5-42d9-9536-5fe41f81c839","year":2019},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.303384Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:5eef0cdfc435a3ff34b695cbcf9477d76d4913869fdb15e275fb40a909875662","observation_id":"11d53f17-102f-4614-b928-e931eeb79990","resolution":{"observed_at":"2026-08-15T22:10:21.409593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04886","last_updated":"2024-10-02T13:40:10Z","snapshot_observed_at":"2026-08-12T23:47:55.771608Z","submitted_at":"2024-06-07T12:32:44Z","title":"Unveiling the Invisible: Captioning Videos with Metaphors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04886","snapshot_observed_at":"2026-08-15T22:10:20.307370Z","title":"Seeing the unseen: Visual metaphor cap- tioning for videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.307370Z"},"links":{"cited_paper":"/paper/2406.04886","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:b3a2269db2cf1bf938565168f297bc5a4ba9c656cc6ab64bb8137851aea73250","observation_id":"1ec608ae-d00b-491e-acc8-c7e38c86d317","resolution":{"observed_at":"2026-08-15T22:10:20.307370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.389882Z","title":"Hydra: A hyper agent for dynamic compositional visual reasoning","venue":null,"work_id":"10dfc6b7-8c6b-436d-824d-a966fe039f2a","year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.312068Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:d37c6cd9e6d335668e8bb1a3185d40699e9d2486fb30a468178ef4d78e4c8874","observation_id":"9f8812c3-d6bd-4c66-a40b-97dbea6cdb58","resolution":{"observed_at":"2026-08-15T22:10:21.394767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.375418Z","title":"Exploring question decomposition for zero-shot vqa","venue":null,"work_id":"eafac0f5-29b1-4758-a0da-64ead4024afd","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.316613Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:1bbd02bd8b7323d2646314c9340831b40623ff5454c20864f74f062e5e901a08","observation_id":"03a10c82-7b4b-4064-938e-72f2afd0b73f","resolution":{"observed_at":"2026-08-15T22:10:21.380548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-14T10:12:58.959257Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-15T22:10:20.321108Z","title":"A survey on benchmarks of multi- modal large language models.ArXiv, abs/2408.08632, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.321108Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:6ec11f0255e599a825f4bb44569ad809560f9bbcc8541ae3ba009a158687f537","observation_id":"e2bf1655-072d-4f17-a59b-36cf535a8729","resolution":{"observed_at":"2026-08-15T22:10:20.321108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.360167Z","title":null,"venue":null,"work_id":"16bea35d-bf70-4f0a-9c39-5fcf34bc0b32","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.326138Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:857bc6331688fbd962ddd8b62e7c70c7ce5ca278ce990aad9e4975c0e0afd17e","observation_id":"2dbf9bf1-7862-4921-b6e7-f7b041da87a2","resolution":{"observed_at":"2026-08-15T22:10:21.364463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.344264Z","title":"Grounded language-image pre-training","venue":null,"work_id":"6d8c933a-f5e7-457b-b6b1-3e5e0ec3bef4","year":2021},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.330701Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:5dbc5dfb27ae7ba6fbe29ff0cc7cd1e99f4b20c4942b1daa175a28d6194a53d1","observation_id":"82eaea41-d40d-432f-92cf-32bd7cc8cba7","resolution":{"observed_at":"2026-08-15T22:10:21.349464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.329493Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"bed85d57-b3fc-4a3e-882d-ca0b56035be9","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.335097Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:3f7f643da964ef8d05ed92e7cdb920461d7c5d20b599803b1352224c590c9340","observation_id":"8422c373-7620-4f7d-b1d2-d2e6a6fa6351","resolution":{"observed_at":"2026-08-15T22:10:21.334420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.314765Z","title":"Visual instruction tuning","venue":null,"work_id":"14ab32f5-5ef4-44dc-b99c-99f82f4a83e7","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.339444Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:01b923a8919aeffbbf09a4d394a96be33176f033ebea8b0cf6f8b63d82814959","observation_id":"2a78b72e-4834-4bfe-8a47-5fdb40126675","resolution":{"observed_at":"2026-08-15T22:10:21.319490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-15T22:10:20.343778Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.343778Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:f9084eb10b50b9fc01d6d708fcaa393a519e8eb6773a48ff865abcf7f73ed818","observation_id":"714d25c7-6672-4128-9412-8bbeed9f8543","resolution":{"observed_at":"2026-08-15T22:10:20.343778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17514","last_updated":"2025-06-17T01:51:36Z","snapshot_observed_at":"2026-08-07T17:56:25.920149Z","submitted_at":"2025-02-22T14:20:07Z","title":"SAE-V: Interpreting Multimodal Models for Enhanced Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17514","snapshot_observed_at":"2026-08-15T22:10:20.348244Z","title":"Sae-v: Interpreting multimodal models for enhanced align- ment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.348244Z"},"links":{"cited_paper":"/paper/2502.17514","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:8666afd24a9c0e36bfa9df5779197af52ed396fb1ede8de160feb5aed73feaf3","observation_id":"a2da71b1-6def-4915-b75b-e768b7b39b48","resolution":{"observed_at":"2026-08-15T22:10:20.348244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.299567Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models","venue":null,"work_id":"9c041f53-f09b-4eb6-9192-ee4ca13cf405","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.353038Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:0a7b70b08f93e451a72ed5490fc7aabd78c43d8cf190e7975603935f4055df96","observation_id":"3314594d-8828-4ee9-a95a-72dd0bd8c313","resolution":{"observed_at":"2026-08-15T22:10:21.304205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.284506Z","title":"Task navigator: Decomposing complex tasks for multimodal large language models","venue":null,"work_id":"960c9c10-cc63-45ae-a96c-71829f2cfb44","year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.358522Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:aef11862a7a4ca428f97a3d0fb3a75eda3e46d55266f7c7a6e559bb757cdb79c","observation_id":"8dd6e76c-f00d-4fce-a56f-341a5f0b2c00","resolution":{"observed_at":"2026-08-15T22:10:21.289200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.364298Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.364298Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:86ca6deed16c721fbcc8f38b9f01da55a6008d4f539aa6c47fa96e6c0ac1e002","observation_id":"098a1cc4-0926-49c3-a0b9-961a7620bcbc","resolution":{"observed_at":"2026-08-15T22:10:20.364298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.369214Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.369214Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:c0805f72a30afca5beb942becc1cc445138510eb5e8c3908591a520dadd03db8","observation_id":"56242bd3-f485-4a5a-b022-16709cf86950","resolution":{"observed_at":"2026-08-15T22:10:20.369214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.249165Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"f7ff184b-5aef-4370-b02c-243673c77a4f","year":2019},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.374649Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:9917da60019f3172ea30a625e288010d865a3b984d3799e4a309cc7e77a772b6","observation_id":"78eaef3a-5e03-43eb-9044-0c9d17e84c99","resolution":{"observed_at":"2026-08-15T22:10:21.254395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.234509Z","title":"Reid, and Silvio Savarese","venue":null,"work_id":"5fed26d0-1ddc-4b84-9561-e462f20e7a20","year":2019},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.379570Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:3e7e4807d9cbc24efdd323c402fd54281b05145b9337b09fc6930b9c8ad087ce","observation_id":"7fb21a7c-3602-48e5-b007-df7500a0dc38","resolution":{"observed_at":"2026-08-15T22:10:21.239321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.219646Z","title":"Towards vqa models that can read","venue":null,"work_id":"141da314-40af-4b71-b564-6c5945e857a0","year":2019},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.384030Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:4414ac78fc5801d8c0b686f10bb682ed7a87d61e7df922f7e8ca74f256171a02","observation_id":"83604e42-d8a2-422a-843b-a44ed6d31051","resolution":{"observed_at":"2026-08-15T22:10:21.224403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.203908Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"c6cf23ab-1c38-4a9e-a8dc-5dd8e2ffc5d3","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.387978Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:e44553752dfeafd6f980e826d6e48881f31842e38ef4ec2d1972df2fff0125bc","observation_id":"a56892f6-6ff5-441c-ba6e-6727218c0fc3","resolution":{"observed_at":"2026-08-15T22:10:21.209077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T22:10:20.392320Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.392320Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:01ee03e6511fdf08337be0689e2866c9c382b39b8c59a36fbc37df29c7ebb1a9","observation_id":"88fa69f3-f3f3-42c7-a819-337d262f4558","resolution":{"observed_at":"2026-08-15T22:10:20.392320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T22:10:20.397283Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.397283Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:f325926c35e30c165b4ae8509b957c491c3bed70ed77078bccdb925cec022099","observation_id":"99dc1080-943a-4b33-bf29-d3a1c23c8a73","resolution":{"observed_at":"2026-08-15T22:10:20.397283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-15T22:10:20.402206Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.402206Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:f6a1fb76ebc17b646bd677e57239990878cb3a8636d2a776a820534788387068","observation_id":"80127df8-7561-464f-9fd8-d4de5a3cc5f5","resolution":{"observed_at":"2026-08-15T22:10:20.402206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.188633Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"da5db929-9f02-48dd-af65-5d23792a9461","year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.406738Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:83c0576ef19e45381f750abcd89962588d85dbf273733b79991e89af23494bba","observation_id":"cc611ff7-469e-4ed2-a66f-4f723daf1d09","resolution":{"observed_at":"2026-08-15T22:10:21.193319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19339","last_updated":"2024-10-07T12:05:55Z","snapshot_observed_at":"2026-08-12T22:35:31.759402Z","submitted_at":"2024-09-28T12:49:16Z","title":"Visual Question Decomposition on Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.19339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.19339","snapshot_observed_at":"2026-08-15T22:10:20.620429Z","title":"Visual Question Decomposition on Multimodal Large Language Models","venue":"cs.CL","work_id":"34990bf6-bf03-4238-85b7-89f3c317b885","year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.410966Z"},"links":{"cited_paper":"/paper/2409.19339","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:774ca1e0a5bc3d6e149ad339dee72a4d58c7e200ad7ff4f98a2a092b88673fff","observation_id":"9e7636c1-ccd7-4748-b7f2-14d408a1f048","resolution":{"observed_at":"2026-08-15T22:10:20.627569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-13T00:32:27.032316Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-15T22:10:20.415537Z","title":"Ferret-v2: An improved baseline for refer- ring and grounding with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.415537Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:ad4eebf311f15436976c24484f8d1a5c873a742d3b4e68e3e31245f6e28b4c2d","observation_id":"3f517add-8723-4f26-893e-fb573d440949","resolution":{"observed_at":"2026-08-15T22:10:20.415537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-15T22:10:20.420225Z","title":"Mllms know where to look: Training-free per- ception of small visual details with multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.420225Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:2c9911046d6e9380bd486dd86149add7db78d22523e9f3bd9100ca737949287d","observation_id":"c653e165-58e0-41d2-abd5-5d228e10c501","resolution":{"observed_at":"2026-08-15T22:10:20.420225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T22:10:20.425142Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.425142Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:bfca527abfdc6723c32fa564bd57e0fbf3a6aaf73e57f2a056f2b930420e163b","observation_id":"fd230b6e-d12d-4a36-835b-306f63f975c9","resolution":{"observed_at":"2026-08-15T22:10:20.425142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.174623Z","title":null,"venue":null,"work_id":"69aeca31-bde6-4629-a03b-abcba0b8f4b7","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.430005Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:c522daf432222d3e715becb27955cf7202ccad3095c87a987e80c51552cb1e2e","observation_id":"15e4033c-4b1e-480a-a8ee-0f54177fe556","resolution":{"observed_at":"2026-08-15T22:10:21.179212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.158396Z","title":null,"venue":null,"work_id":"8e1b2ce4-0297-4cdc-ad7d-6fecf5668fda","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.434618Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:ffe2c16c54e96a431ed9ff7d6c734ecb2c7132b386e1fa6664126cc0fb58433f","observation_id":"a1bc3843-4473-4ec6-810a-652359377a16","resolution":{"observed_at":"2026-08-15T22:10:21.163826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.143908Z","title":null,"venue":null,"work_id":"b1f8cef5-d9e3-454e-a112-817bcc945d88","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.440312Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:94c125cc1fe38250d3b7462b4e06998dad23e7ee9ef6318a7e415c05a4911e20","observation_id":"24154824-e96c-4800-aee5-c2399b8ee17f","resolution":{"observed_at":"2026-08-15T22:10:21.148370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.129384Z","title":null,"venue":null,"work_id":"ef1aac0f-bd39-4a96-b401-450b545e20ac","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.445059Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:40a88f2a2bce8f1977547db602b03ccf4b48c176fcf6fe667016b17786e634a1","observation_id":"55b571ae-f6ec-4e07-a902-966a13d8760e","resolution":{"observed_at":"2026-08-15T22:10:21.133967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.114144Z","title":null,"venue":null,"work_id":"d5715e7b-6333-49ec-a38a-4851700e8ac8","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.449493Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:0c978ad99972733c0b9a5a4be6ca766f19e7fc25cba517bb4c587efa7ead8dbf","observation_id":"c0081a71-aa4e-47f9-8540-025afa851375","resolution":{"observed_at":"2026-08-15T22:10:21.119511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.100238Z","title":null,"venue":null,"work_id":"143431dc-e2e3-4634-bc85-fa464342bed9","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.455126Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:2221e015f88e4f2d7b79fd905cd662797fa4043a2cb4f974a7890df8b5ef570f","observation_id":"aa8aa685-70b3-4c5d-84ed-cf5f06946d2b","resolution":{"observed_at":"2026-08-15T22:10:21.104652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.085303Z","title":null,"venue":null,"work_id":"f7853fe5-82a0-4619-a944-2e5eaaf3ca1e","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.459528Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:521474998d1c9c939708d5fd1c616c374b2e9550a0b65aa10ac3e1328c81af61","observation_id":"bcc2dedb-6211-439c-8a98-893a60aa2805","resolution":{"observed_at":"2026-08-15T22:10:21.090074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.069152Z","title":null,"venue":null,"work_id":"be67f787-03f4-41d2-81f6-b2cd5dbf1d2a","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.464202Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:4f8e81924750b51cca3b74076c5fbec49044b1ff3e69c98623b004b4f8426571","observation_id":"c3a13de9-2ac2-4ed5-8023-a54cf1a0985b","resolution":{"observed_at":"2026-08-15T22:10:21.074152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.052798Z","title":null,"venue":null,"work_id":"556cefe6-6388-4b4d-95fa-cd96b20fcfda","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.468971Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:1cad90ebf974659dd2e192839fac8f4749429833a2e274606baba096d56566a2","observation_id":"21dace39-e704-4965-8530-0ff3222ee89e","resolution":{"observed_at":"2026-08-15T22:10:21.058533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.037784Z","title":null,"venue":null,"work_id":"cb53c617-663b-42c5-8a4a-b88f0b39324a","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.474476Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:7ddd49aa5f69e2e5eac81770ee298a8e49d416ecd95be612397f1f85dd423ba2","observation_id":"ee11851a-e4a0-4335-8be7-2f146bdc28e9","resolution":{"observed_at":"2026-08-15T22:10:21.043097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.023077Z","title":null,"venue":null,"work_id":"eb31e115-3082-469f-8dd6-d989ee93089d","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.479284Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:0c01b922694ada3b4ef67ee1b238616b35ca67e89dc4d97885ad9280395dc270","observation_id":"431f83bc-9237-4d31-8344-0b339c2e1b6a","resolution":{"observed_at":"2026-08-15T22:10:21.027802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:21.008395Z","title":null,"venue":null,"work_id":"d6533108-4ce1-4267-adb2-18b5aeecdd9f","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.483962Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:31480a871145d978f2f92da9a9f6b38fa7d14bca87eebfdfadae5147d60fba4a","observation_id":"77845619-6325-4233-80eb-14ee0e682b38","resolution":{"observed_at":"2026-08-15T22:10:21.013149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.993238Z","title":null,"venue":null,"work_id":"84837419-8b5d-49cc-8037-b28a7e458447","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.488975Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:3985e5236a5846b6a847f66e56419b5767c0c17ef3776c83f70f38d7a8389c1c","observation_id":"9da2bdb1-3efa-4246-a605-3cb69671eb11","resolution":{"observed_at":"2026-08-15T22:10:20.998129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.977765Z","title":null,"venue":null,"work_id":"4e5b2540-b62d-44c7-9be3-ebfa7bfae79a","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.493679Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:2bca663ecb44c21e0843ecabedf49c4363ca603c3e0d31b285971884f933cbdc","observation_id":"f641b501-ac5a-4a7b-a387-838ba6ba578c","resolution":{"observed_at":"2026-08-15T22:10:20.982509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.962132Z","title":null,"venue":null,"work_id":"75a8c575-5767-4c1f-b03d-8003f97ec1f6","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.498344Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:6b3fc575d05f40491b72c1bd2f8ffbffe66bff9a397667d5375cb011efa26865","observation_id":"ff43abc4-5a44-4201-9788-d387e55320e8","resolution":{"observed_at":"2026-08-15T22:10:20.966695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.946811Z","title":null,"venue":null,"work_id":"cccafb97-72fd-4b70-a053-43b2058458a0","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.503066Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:52d703d928271cd4eb7895e16c54724c21b37144342cb7a41849f0d9bef169b5","observation_id":"caeaaf21-d7ea-46eb-aa83-801862f25198","resolution":{"observed_at":"2026-08-15T22:10:20.951309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.932269Z","title":"operation","venue":null,"work_id":"05cdac2e-1438-4507-97c6-24aedc623c05","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.507604Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:9019e2f2934bdf2a1317135c79046f8d0657a1d83a4b9fc99c8976b65273d065","observation_id":"0e6ec4c6-662e-488e-ab21-9f12c52a8dfa","resolution":{"observed_at":"2026-08-15T22:10:20.936940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.916880Z","title":"operation","venue":null,"work_id":"71998f71-19d3-4ead-ace2-d525e4424a7b","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.513204Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:dc46ff5dfeebb7c1015c6221024ca98bf62612f89b9fc3ced07d3de6869025be","observation_id":"e13435c8-bd9f-4127-aee1-3b75ae3e0f11","resolution":{"observed_at":"2026-08-15T22:10:20.921903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.901350Z","title":null,"venue":null,"work_id":"9b395159-5515-4a91-b8a9-d413223867ad","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.518928Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:62d1052e4b8b2596c116795cb32fc648ec13669bd7f4445c0b4d5ac5fc0fc593","observation_id":"18fb048a-64b3-4e47-903f-07ec1da242fe","resolution":{"observed_at":"2026-08-15T22:10:20.905909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.886643Z","title":null,"venue":null,"work_id":"c0e50bfe-33fa-4ea6-a65d-2c024fc9020b","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.523526Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:a59e98d4761f0923281ca010b8b75fe32a545f4a4f2780cb8767d918301ab142","observation_id":"56da4b2f-b488-4a35-8b9e-3d49453cd90f","resolution":{"observed_at":"2026-08-15T22:10:20.891315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.870116Z","title":"Noticeably, For Operation ’choose rel’ in the last step, keeping identical with Final Answer","venue":null,"work_id":"9a137b83-0f52-4280-8c36-baf01d01b178","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.528061Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:483896edde0a14ca147af065d366c0c79f5e14047a5844a35fb7808ce7d00868","observation_id":"4bd68034-c971-4b4a-addc-0163be50cd2c","resolution":{"observed_at":"2026-08-15T22:10:20.875913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.854596Z","title":null,"venue":null,"work_id":"91aa4efb-8648-4374-8f1b-9f383eef5bbf","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.532673Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:52b38aeb66a2a0414b9a01b15b20b1fa4898dca00885a98dba578c3778194c0b","observation_id":"1da92d97-04e5-4781-9466-ba116211781f","resolution":{"observed_at":"2026-08-15T22:10:20.859793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:10:20.839497Z","title":"attribute value","venue":null,"work_id":"5985399b-36bd-433a-a28f-fb8cf2bdd4e4","year":null},"citing_paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T22:10:20.537125Z"},"links":{"citing_paper":"/paper/2505.08084"},"observation_digest":"sha256:4a30f9c1d35c7b37a26a296a1baa985be0a360e4776cb3298a5682be18c57f60","observation_id":"6cc01cd0-d368-43e8-a3b8-45b4553e1f34","resolution":{"observed_at":"2026-08-15T22:10:20.844059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08084","last_updated":"2025-05-12T21:37:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T22:01:57.032595Z","submitted_at":"2025-05-12T21:37:06Z","title":"Visually Interpretable Subtask Reasoning for Visual Question Answering"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2505.08084."}