{"as_of":"2026-08-18T14:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b66b85db568321487c526b2a7d13eca75fcd0c69027dfa9c0279acf2e92b4259","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:46:32.749086Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:11:02.464556Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:14:20.876165Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"cited_work":{"arxiv_id":"2505.09118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.09118","snapshot_observed_at":"2026-06-30T07:14:20.876165Z","title":null,"venue":null,"work_id":"329c3ea0-1051-4809-a737-2483db895203","year":2025},"citing_paper":{"arxiv_id":"2606.29425","last_updated":"2026-06-28T14:40:01Z","snapshot_observed_at":"2026-08-05T16:29:32.428034Z","submitted_at":"2026-06-28T14:40:01Z","title":"Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T07:11:02.464556Z"},"links":{"cited_paper":"/paper/2505.09118","citing_paper":"/paper/2606.29425"},"observation_digest":"sha256:c497198b285088eb25b1c46894849742288306db6d44b4efba76b06ed5d764b2","observation_id":"d0d34ec4-6bf9-45c3-99e9-bda1de719a45","resolution":{"observed_at":"2026-06-30T07:14:20.877492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.09118/citation-record","integrity":"/paper/2505.09118/integrity","json":"/paper/2505.09118/citation-record.json","paper":"/paper/2505.09118"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-15T21:46:32.484993Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.484993Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:c6ad56c6e8c619fa09f978d9fc1ff511dd219090f9cd665ecdcf478882c430f4","observation_id":"fe2c70e0-cff6-416a-8dd9-27f12a166e6f","resolution":{"observed_at":"2026-08-15T21:46:32.484993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.520408Z","title":null,"venue":null,"work_id":"91f7c384-0ff0-4668-88ff-b44eb55d2d60","year":2021},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.489879Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:aa237db0a0374d82ddb7466b18666936d43b57bbb8daaa1b3d3ba97661f9bcf9","observation_id":"ca777a10-efe4-49e8-971e-c61244dbff29","resolution":{"observed_at":"2026-08-15T21:46:33.524290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.507356Z","title":null,"venue":null,"work_id":"dda306fd-9240-49ec-8408-f89890e8508f","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.494023Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:8e06527c9836a0524dced7baeab70185ca833645bae05ea1fd46a3cff1ec4736","observation_id":"64b013b5-42c1-4edc-86c0-dad766c0cf2f","resolution":{"observed_at":"2026-08-15T21:46:33.511654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-15T21:46:32.498304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.498304Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:17b6e48558f7145fcff9ec3a309b09296388a9aae68996e0704c92a300366dfe","observation_id":"7650f597-ab3b-4af8-a7d1-64b447d35949","resolution":{"observed_at":"2026-08-15T21:46:32.498304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.502700Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.502700Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:35f396b95126e1af2fb7da9d6f4a00aa222597b6f37eb423116b086735b286e0","observation_id":"6c20f0be-8851-46a4-b78f-fdc4ce3987be","resolution":{"observed_at":"2026-08-15T21:46:32.502700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.510672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.510672Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:d56aba0060d33b677c24da38a07b0c5bc9f9fbc88a029a366b3a0c5169d4e56a","observation_id":"108af4b2-e4e5-4c5f-b8d4-4459901a9392","resolution":{"observed_at":"2026-08-15T21:46:32.510672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.482143Z","title":null,"venue":null,"work_id":"757b2b1e-a242-463e-91b5-69326b1af91c","year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.514846Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:0a871c31ccb1168229efd1e04b0b1810c423611df3ad23f31addfef0dc0e333b","observation_id":"693a4800-8943-44f8-9734-a9b836fa72bc","resolution":{"observed_at":"2026-08-15T21:46:33.485429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-15T21:46:32.518348Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.518348Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:5371fe1b765447b5f3c708b1724975b9cded421c3b8f34a3660b528a43fe9cfe","observation_id":"e9055d57-2b38-465e-89f1-8c0d20c63852","resolution":{"observed_at":"2026-08-15T21:46:32.518348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.522122Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.522122Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:97ddefcd68f0e97a435fb2ae779cf9afdb45a0f78f0f1bbb18d3d0e6d7923488","observation_id":"135417eb-5952-45b9-890c-037c4038ca25","resolution":{"observed_at":"2026-08-15T21:46:32.522122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.526083Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.526083Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:d58f3653c311375adbce722bed914a81a51b99325958e7f3f91aefb45bf5ab4c","observation_id":"5ceaa70e-6c74-46be-b9b4-f122b067ff33","resolution":{"observed_at":"2026-08-15T21:46:32.526083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.451171Z","title":null,"venue":null,"work_id":"942e77da-1f48-4fa5-ac14-5368aa1e3207","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.533273Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:2d09919cfeb07463d1b5daf714b63ec4a31147a9458b21b9ce4b731f9b73e321","observation_id":"86018529-ba52-4dd5-8e0b-69def92f17f7","resolution":{"observed_at":"2026-08-15T21:46:33.454478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.536528Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.536528Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:fe5af888792efd8fcda78256c69d4b06c563a6abca748b0cd8f9ed15013c9038","observation_id":"a468037d-4d17-4671-b329-215a4293dbf6","resolution":{"observed_at":"2026-08-15T21:46:32.536528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.433754Z","title":null,"venue":null,"work_id":"0513e4a5-4ab9-4383-8198-c20c69086b7c","year":2022},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.539807Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:ccc8f2becf1296029ad5b09d22fa4f500714b76bf47f514c562afd782edd7fb3","observation_id":"7a35c10b-5dea-44b3-ba4f-6b4e78c5b470","resolution":{"observed_at":"2026-08-15T21:46:33.437179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01417","last_updated":"2024-08-02T17:51:57Z","snapshot_observed_at":"2026-08-16T13:28:53.951084Z","submitted_at":"2024-08-02T17:51:57Z","title":"Talk Less, Interact Better: Evaluating In-context Conversational Adaptation in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01417","snapshot_observed_at":"2026-08-15T21:46:32.543218Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.543218Z"},"links":{"cited_paper":"/paper/2408.01417","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:2fbf145a593d11073beaacfd472529bfe86a8feeda39dec7e031901af964e8fd","observation_id":"600bb012-2fae-457a-a976-47fd38fce154","resolution":{"observed_at":"2026-08-15T21:46:32.543218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.422241Z","title":null,"venue":null,"work_id":"186f88a2-48e1-4cb7-a01a-28942a333826","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.546593Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:754d3f3d17ae69c1c12d811423ca6a10de4d7048a247e38c619473492951308c","observation_id":"eba7cefa-5d9e-417d-bfe0-90e5b5b37306","resolution":{"observed_at":"2026-08-15T21:46:33.426243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.550215Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.550215Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:980dc01218d7250ebfb03f9897f5ed2c8bec308aea74f9fa01739be4f79bd7c5","observation_id":"5b2c63fe-e610-4d3b-af5d-652de6437c21","resolution":{"observed_at":"2026-08-15T21:46:32.550215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-16T13:42:28.139786Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-15T21:46:32.554927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.554927Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:0b7df998bf8161d82d32c6d337c718692972c1a5c0ac18c7d934e0bdbc475047","observation_id":"270663b6-84d1-4a17-b27f-740ec23feaa1","resolution":{"observed_at":"2026-08-15T21:46:32.554927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.559106Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.559106Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:28e82d663962b1ef721f1a9e7045c79607e36db542f7e0d1049bbd063f1a3d2c","observation_id":"9a6eed4f-86f2-4201-8207-b271bd33c015","resolution":{"observed_at":"2026-08-15T21:46:32.559106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.563270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.563270Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:7f3acfc7f29e65b013b800d5ea8694eeceffe000e3e8f936d5ad68a2fb84371a","observation_id":"640c7e61-d748-4491-8ed2-6e70325b594c","resolution":{"observed_at":"2026-08-15T21:46:32.563270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.571125Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.571125Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:9f0501158f53baf529af7736fde339d7ea75c5580ff647e759777f0720fa9527","observation_id":"1ad0aa57-f6da-4ba9-8d63-5a999cfd9d35","resolution":{"observed_at":"2026-08-15T21:46:32.571125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.373514Z","title":null,"venue":null,"work_id":"bbfc1485-c484-4ba5-bdde-eb3330ec76b8","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.575652Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:0bfbca5b7ef4f47e213de13f0733c9daf1280cacb0255763f8e1c9e4298d4f9d","observation_id":"498ef88b-311d-48cc-86fc-f8fe5a54f288","resolution":{"observed_at":"2026-08-15T21:46:33.377229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.567261Z","title":"International journal of computer vision 123 (2017), 32–73","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.567261Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:450c35d160928ed8360f7e0967a211527ebcc5f173d0f84a6e60acc68286c8b4","observation_id":"9f394feb-2315-4413-93e7-aaaa9922f7b5","resolution":{"observed_at":"2026-08-15T21:46:32.567261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.583403Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.583403Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:bdf09d70aa9aa78e9bbaf5e3fdcaf5799fc45a570d55e20f06547ceff48d012a","observation_id":"cea41c8d-645e-4e0a-8a99-a00ccf697ead","resolution":{"observed_at":"2026-08-15T21:46:32.583403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.347663Z","title":null,"venue":null,"work_id":"133d5f90-c880-44a1-ae66-4fd2b2677ddc","year":2022},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.587506Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:a290b3a7ff9d9c1d27ba7a9e57bb27e009f1273ea4e9a6a0995ef86ecb8fafb9","observation_id":"b0aca05b-7507-47bb-87fd-67883281d908","resolution":{"observed_at":"2026-08-15T21:46:33.351466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.579501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.579501Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:f37ffd4811fafccba4a130a5fb458d8515ab967bfad4244689b94af57dc41fec","observation_id":"a91a7f99-530b-440b-b59d-91a0ecaf9af7","resolution":{"observed_at":"2026-08-15T21:46:32.579501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.335314Z","title":null,"venue":null,"work_id":"0350fc7c-a99a-4e82-a5e0-7e056fd20794","year":2020},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.595681Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:f01e0dad229ee931a0222aa2d01bf9fd178c603767c79479e6622774236b0a8a","observation_id":"7724a97f-cfcc-4c98-8035-5d0dce267496","resolution":{"observed_at":"2026-08-15T21:46:33.339568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.323600Z","title":null,"venue":null,"work_id":"27415255-bf81-463b-bc59-6c59b4896776","year":2022},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.601176Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:bdcdd587710a03443277413641d253b52ef6c0e49cd9b4ed1f21c466bc964a98","observation_id":"f06a70cd-9d61-425f-bb38-756d8b196616","resolution":{"observed_at":"2026-08-15T21:46:33.327445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-15T21:46:32.591591Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.591591Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:b347076f8eee116ba306a81bbfdac31f5e708b08652e0260d98965d14e695465","observation_id":"a29dd3bf-55c5-46f8-95f3-ea4ea4e223a0","resolution":{"observed_at":"2026-08-15T21:46:32.591591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.609115Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.609115Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:fbc650b1d325593ee526e4a4fb79412fd3489a35b618230e8846dae37381040a","observation_id":"ae71b79b-ec48-4838-b68c-6b51fd0aaf75","resolution":{"observed_at":"2026-08-15T21:46:32.609115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.616868Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.616868Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:712fdea5354322e921504e9f98084cdc464e781e97a556cc8ee890e2879f485a","observation_id":"c83e1f6d-cf8a-476a-a0b6-543752d6413a","resolution":{"observed_at":"2026-08-15T21:46:32.616868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.604995Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.604995Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:9665e08bc9e0e4a0a5cdabe89d44d9e248b2e54906e6cfcbe523f7ad53fb87bf","observation_id":"2499ede0-6221-44b3-ba0a-b9ef10247007","resolution":{"observed_at":"2026-08-15T21:46:32.604995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-08-16T14:31:46.566838Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-15T21:46:32.624657Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.624657Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:7568b436d6184c139ab2042b908df0cabb09b96ad2b9520672f6ff4b98983de3","observation_id":"6874933b-cdb5-4814-9102-2f4515047035","resolution":{"observed_at":"2026-08-15T21:46:32.624657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-15T21:46:32.612929Z","title":"arXiv preprint arXiv:2306.14565 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.612929Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:e3b54caa7ec05d3113e8218ad9460986e779daed1b78765107c562e03cf4741b","observation_id":"d2bb92f4-d370-4335-9e8a-06c5c3336ffa","resolution":{"observed_at":"2026-08-15T21:46:32.612929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07074","last_updated":"2023-08-15T07:37:32Z","snapshot_observed_at":"2026-08-16T22:33:06.082574Z","submitted_at":"2023-08-14T11:16:28Z","title":"#InsTag: Instruction Tagging for Analyzing Supervised Fine-tuning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07074","snapshot_observed_at":"2026-08-15T21:46:32.632306Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.632306Z"},"links":{"cited_paper":"/paper/2308.07074","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:154425aa4f53d1ca1c5b99e5dae588ab6f68fd2e5708469388acd898a1d7cb85","observation_id":"7c372cf1-b92d-4c13-9d85-821b14d4fbf6","resolution":{"observed_at":"2026-08-15T21:46:32.632306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.290380Z","title":null,"venue":null,"work_id":"ffbe9505-0652-4c0a-b2c5-aef34169e23f","year":2021},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.620670Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:213114ef75594c5f3a8e641741aa7a39c5db9b60c7f6e7922528bebb99008693","observation_id":"8e8dfa81-9264-4af9-8c5b-16ae82e793f9","resolution":{"observed_at":"2026-08-15T21:46:33.294462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.254163Z","title":null,"venue":null,"work_id":"fca554cf-e02e-4544-ab8c-322f911ce803","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.640109Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:00354efd482220149fcd845f5b44ec4c37a593850d6f7107ee55a1e9abd00c96","observation_id":"2c10dfc9-4412-47da-9d5b-c01449dccc89","resolution":{"observed_at":"2026-08-15T21:46:33.258723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.628793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.628793Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:b262f26d67efa223a2a32328403d3bfa7d135ecea380f9758afc3e9a4aefd33d","observation_id":"2aa3dd4e-4383-4ba8-81d3-fda8e3bf824d","resolution":{"observed_at":"2026-08-15T21:46:32.628793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-15T21:46:32.648094Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.648094Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:cbe8c5ecc58d7665b493b8dc6f4c1797ccc2fa226ad9ff34a4989100afd0e40e","observation_id":"48590838-8881-458e-921a-85c7cc21d896","resolution":{"observed_at":"2026-08-15T21:46:32.648094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.266809Z","title":null,"venue":null,"work_id":"c087e104-f9e9-49e9-9750-a041038eaf2b","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.636276Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:3dac8c63a1ac7bf728453c948c6a14787c3ada18087dcb350cad0d5a83ebfbba","observation_id":"3452de8b-0a78-4708-9f97-08585edcd770","resolution":{"observed_at":"2026-08-15T21:46:33.272664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.655993Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.655993Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:76140f0f8665febd26d157670d6e25bde80460548845b291c8d8b22396cb1649","observation_id":"6bbd4126-4876-4242-ba64-55788d2f6436","resolution":{"observed_at":"2026-08-15T21:46:32.655993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-15T21:46:32.643808Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.643808Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:a40fbad4196a875abf78bb3218c2b2f8bea6a2589c51b1b0dc0256e2f953341d","observation_id":"f42ef5ea-dfcd-43ab-a68d-cc3e9331ff72","resolution":{"observed_at":"2026-08-15T21:46:32.643808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-15T21:46:32.663414Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.663414Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:8c5f9c07a82f5de0e850880edd739654f8aed5960575ce248781acd0343f8ba8","observation_id":"8cd91289-a74b-44e6-9b00-ba0b3cb40256","resolution":{"observed_at":"2026-08-15T21:46:32.663414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.240680Z","title":null,"venue":null,"work_id":"d0d24cf3-2c8a-4e95-9801-45130469b796","year":2015},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.652222Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:af70b75aba49e24c39ff9d0efc735e4600b0f665926db590b9f3ccb45866d2f1","observation_id":"1ade2d10-616d-4f40-bea0-8e4fa24c10a3","resolution":{"observed_at":"2026-08-15T21:46:33.244936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-15T21:46:32.670495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.670495Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:41b1eba6eebb1b4fa167ec4f53dcca9a40abdf1095733af831868be86be2458e","observation_id":"e9fbeeaa-147d-48ab-8af4-d1dc59b836ec","resolution":{"observed_at":"2026-08-15T21:46:32.670495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-15T21:46:32.659594Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.659594Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:4bb4b22fbb26e1a2e2a04e7a40d8ce970662667e593a4d2a284fd850abec735c","observation_id":"14457149-d8c8-458f-8c05-403f4c7648bd","resolution":{"observed_at":"2026-08-15T21:46:32.659594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.208891Z","title":null,"venue":null,"work_id":"3f8139de-de9a-4663-824c-ca2bf79c69c2","year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.677492Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:20d383d5ca078a5a0cf5f10408818baf15d6d0ec3223a1719be68b5c36f8fc13","observation_id":"27ee7363-6615-408f-837d-95bb62da53f9","resolution":{"observed_at":"2026-08-15T21:46:33.212870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.221469Z","title":null,"venue":null,"work_id":"e83479ec-bd71-49cd-81ed-8f2e974814dd","year":2025},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.666925Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:9e58e205072edfa2b6b8ec2861532cb6b82abcfa128b309edf346f361ac92db5","observation_id":"253cfeb2-28fd-4360-8773-a9d1dac4cc83","resolution":{"observed_at":"2026-08-15T21:46:33.224849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11690","last_updated":"2024-02-18T19:38:44Z","snapshot_observed_at":"2026-08-16T14:17:33.847507Z","submitted_at":"2024-02-18T19:38:44Z","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11690","snapshot_observed_at":"2026-08-15T21:46:32.685395Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.685395Z"},"links":{"cited_paper":"/paper/2402.11690","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:50daf05d249c8633b143bcd76cd599e708c4e03ad2b80aa8600d3ff6123f9d1f","observation_id":"4f558daa-f18f-4a5a-8bef-377f8df8026d","resolution":{"observed_at":"2026-08-15T21:46:32.685395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T21:46:32.673777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.673777Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:6c2a7455ac01270bcca2c47341c7be107dfcade45b9e66c339cbb185a1b7f754","observation_id":"fb679c5a-8827-4061-aee7-c07d5c49e649","resolution":{"observed_at":"2026-08-15T21:46:32.673777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.174683Z","title":null,"venue":null,"work_id":"faa84a33-4294-40b1-95fa-570b29bff870","year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.694451Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:58bc947b04080f473664355b05d453b4fc240e0e948daa090978a8d7d20668f5","observation_id":"8f1fc05d-263d-418c-a434-feaeaf035045","resolution":{"observed_at":"2026-08-15T21:46:33.178332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.197098Z","title":null,"venue":null,"work_id":"01396156-18a9-48ed-ae08-84ab042dbe29","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.681740Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:b5e4cf0332900e0fc5a4eaf1a96dbf0b4256dd2b5e90ba99bcee46ebb9bc3b94","observation_id":"f44f3d03-16d9-4e16-aa5e-0d0a5e929529","resolution":{"observed_at":"2026-08-15T21:46:33.201682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.702038Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.702038Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:bbc5eaa60530fb4783ef8af8f1c19e2f790cdec980d6e05477ecfa4501a2693a","observation_id":"6f35519b-5595-47c7-89a4-6ae29a98db82","resolution":{"observed_at":"2026-08-15T21:46:32.702038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.185787Z","title":null,"venue":null,"work_id":"1ebed93e-351a-4e4b-8e60-0bca97239f92","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.690018Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:3e34d43387fbbd93994bf460e0f6fd4bce158638f43d5fd33775e48f40b53ac5","observation_id":"5700b233-dd1c-4d10-9b45-cc8772485ea1","resolution":{"observed_at":"2026-08-15T21:46:33.189245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.137381Z","title":null,"venue":null,"work_id":"03c2707c-182b-44e6-b60c-c28670b53583","year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.714720Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:0910e9e3892a287310738a8095ae5cb2d6f22f1b6f513216230b1f38ba265af6","observation_id":"2588ec95-6ce6-4a29-9409-1f98ca454302","resolution":{"observed_at":"2026-08-15T21:46:33.141108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.698380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.698380Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:24149faedb9e1bb57850d7a2abd2ab1ec4069f791ec74d82a6c06fd06ec42ca5","observation_id":"babc3aac-4f90-454b-a4d2-a38b77deee3a","resolution":{"observed_at":"2026-08-15T21:46:32.698380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.722238Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.722238Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:0c4cd294f687ad2ae984999909b160818394b73fcf0ab6244df3e417d47fc041","observation_id":"b0f6c79e-dae6-49e9-8ee9-25d18e881094","resolution":{"observed_at":"2026-08-15T21:46:32.722238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.149301Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"31cea82d-0a6b-40e1-bace-5ae27151f15d","year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.706011Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:39003fb141435f7da06e76849b7c58eb0907abda84042146d7f97bcdc743c814","observation_id":"0b0881ec-37aa-466c-807a-aa050aa91ef0","resolution":{"observed_at":"2026-08-15T21:46:33.153280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03070","last_updated":"2025-02-07T04:20:54Z","snapshot_observed_at":"2026-08-16T13:45:58.926186Z","submitted_at":"2024-06-05T08:55:02Z","title":"A-Bench: Are LMMs Masters at Evaluating AI-generated Images?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03070","snapshot_observed_at":"2026-08-15T21:46:32.709744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.709744Z"},"links":{"cited_paper":"/paper/2406.03070","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:b050ab09738159370c9d1b70c794cfdfe01cd4f3e97abe8904e4457c5826ab02","observation_id":"2220eef3-5d3f-46ad-a08e-eafd0a89da07","resolution":{"observed_at":"2026-08-15T21:46:32.709744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T21:46:32.733861Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.733861Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:bf03e302c943ec4a7e278b7d1ee0a60316c65765ce760cc39de7e8b1d20499f0","observation_id":"865fe1a7-9e18-4066-8ad2-cd2445e186a4","resolution":{"observed_at":"2026-08-15T21:46:32.733861Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.123324Z","title":null,"venue":null,"work_id":"7e025a58-a8a9-44f2-8ba4-a72b03da950a","year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.718445Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:820e4c187ef7b588b220df6728232f789fe0335946ba8a557281fd0149737899","observation_id":"169f20ff-e6b2-420c-85ac-174e26a9ee8b","resolution":{"observed_at":"2026-08-15T21:46:33.127762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.725986Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.725986Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:aa9067e5ae1b09e51549bd35669ddb20744407e26f83c83f1b65eb539a46e964","observation_id":"c41b6b79-53db-463e-b4a7-d793c781695b","resolution":{"observed_at":"2026-08-15T21:46:32.725986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16492","last_updated":"2024-06-19T19:48:35Z","snapshot_observed_at":"2026-08-16T14:39:58.093803Z","submitted_at":"2023-11-27T17:05:25Z","title":"VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation","version":2},"cited_work":{"arxiv_id":"2311.16492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.16492","snapshot_observed_at":"2026-08-15T21:46:32.800795Z","title":"VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation","venue":"cs.CV","work_id":"759f7071-3f16-476e-bbcd-84ebd593f9c8","year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.730168Z"},"links":{"cited_paper":"/paper/2311.16492","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:cad282fc6da2689c019309330d6d50b2abd176a84ea74c3ac67fe7d55a64af5c","observation_id":"6555c831-6e64-4344-b131-1cadaf870e19","resolution":{"observed_at":"2026-08-15T21:46:32.807084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.088615Z","title":null,"venue":null,"work_id":"132049db-2f19-45d0-afd6-63dc7eb6b5ba","year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.738040Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:680a9c14033885eb01c16227da761c3c4419f1c2e3d7dc371b86b96d20f0ec8f","observation_id":"8e4da9c8-4827-4087-969b-f91145430de0","resolution":{"observed_at":"2026-08-15T21:46:33.093460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.073856Z","title":null,"venue":null,"work_id":"a046b10e-e84b-4156-8ae1-3a52f0c0f5a8","year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.741657Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:7bbd47a04cce6cd26980ff7602ccf1637d7c0095f320f56ec0bd98ccc63f7334","observation_id":"d3560ba8-ef8f-4027-83ad-cdeadba51043","resolution":{"observed_at":"2026-08-15T21:46:33.079047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.061018Z","title":null,"venue":null,"work_id":"a53d5a66-2a95-4735-abc0-4469859710eb","year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.745351Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:2d9d66c0cae6ab4e296593354c80b16f21efa9c7c32a2c71c827c13da059ae90","observation_id":"af8f94e6-a77f-42c3-b071-1c317cf12495","resolution":{"observed_at":"2026-08-15T21:46:33.064723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:33.046050Z","title":null,"venue":null,"work_id":"e874f3ae-fb2c-44b1-a9b7-ea1ada5a29da","year":2025},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.749086Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:d6376e59080734ff0290b8fc764fcc83f1f05673d8c94371c8a1fd36f00b4290","observation_id":"c3a686c7-0960-46b4-aff4-c96910834b0b","resolution":{"observed_at":"2026-08-15T21:46:33.052510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:46:32.529788Z","title":"In Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.529788Z"},"links":{"citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:d83b370d6d37ef8e4d599f348dbf7f171c8a3d25a1a98c874c8d2f9e7a06db9c","observation_id":"56fffcb5-3916-4186-951e-f17f3d735353","resolution":{"observed_at":"2026-08-15T21:46:32.529788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-15T21:46:32.506569Z","title":"arXiv preprint arXiv:2306.15195 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T21:46:32.506569Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.09118"},"observation_digest":"sha256:ecc4577eaeee361b702a79dd9d15944ccac718d8266b3083c2c1c7b7dc5d5c57","observation_id":"11210261-7067-4124-8809-8b0f5a25ca79","resolution":{"observed_at":"2026-08-15T21:46:32.506569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.09118","last_updated":"2025-05-14T04:04:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:53:35.494036Z","submitted_at":"2025-05-14T04:04:23Z","title":"Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2505.09118."}