{"as_of":"2026-08-21T17:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b241ee738b63627e73cf611a53709aeb0b97b177553a5a683ed82b355584927c","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:19:13.746242Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:03:52.566413Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T04:00:54.597918Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"cited_work":{"arxiv_id":"2501.02201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02201","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acknowl- edging focus ambiguity in visual questions","venue":null,"work_id":"ffc16eae-4e18-4f94-baa2-72964ee0a630","year":2025},"citing_paper":{"arxiv_id":"2605.07817","last_updated":"2026-05-08T14:49:10Z","snapshot_observed_at":"2026-08-15T02:23:18.156518Z","submitted_at":"2026-05-08T14:49:10Z","title":"GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T02:03:52.566413Z"},"links":{"cited_paper":"/paper/2501.02201","citing_paper":"/paper/2605.07817"},"observation_digest":"sha256:421f24763036c56599b237c1556fabda997b052f37562821224071c75ce01b0f","observation_id":"9d2d9f48-67ad-40c4-af68-19c80ac32b63","resolution":{"observed_at":"2026-05-11T04:00:54.599999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02201/citation-record","integrity":"/paper/2501.02201/integrity","json":"/paper/2501.02201/citation-record.json","paper":"/paper/2501.02201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.539807Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.539807Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:9e68a0d309549cd1e20b0fd1e357c6f0ff0e0444f514cd0c37665de1dbe5293d","observation_id":"1db03ffc-a8cd-4cb3-95ea-be41ea326195","resolution":{"observed_at":"2026-08-10T22:19:13.539807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.544017Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.544017Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:d214a8e6a6eddec0179943be24b3720e5577050cfdc7484bea61a4495f73b412","observation_id":"abb0115e-9ccc-42c3-a432-c218d43d2764","resolution":{"observed_at":"2026-08-10T22:19:13.544017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T22:19:13.547498Z","title":"Analysis on the results of the prediction from GPT-4o in the GPT-4o + GLaMM approach for locating question focus regions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.547498Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:c0da6241ed30667657382b4e66c018c26c614a5bf5e5de31f2c5fe16ac39ad54","observation_id":"046961b5-25f2-4b06-adae-f8c25fdb0829","resolution":{"observed_at":"2026-08-10T22:19:13.547498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.377444Z","title":"Why does a visual question have different answers? In Proceedings of the IEEE International Conference on Computer Vision , pages 4271–4280, 2019","venue":null,"work_id":"1bb01713-84c1-4475-a374-f2b8a13b45b2","year":2019},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.551497Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:0ea1908569169d3ef38650258232e5775984de599a9aa297fc23da6185f5123b","observation_id":"2caccec5-8c0d-4c12-985c-10cf576219e7","resolution":{"observed_at":"2026-08-10T22:19:14.382252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.365335Z","title":"Grounding answers for visual questions asked by visually impaired people","venue":null,"work_id":"e812a2b1-e20d-41e6-bcf4-7c33297687f4","year":2022},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.555292Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:7784356e3f87d808703f1b892d0d8c4f57d456be277badc3a2c9e4b0eb6a9e51","observation_id":"35cf7e17-5a7b-4327-bf6b-7dbb48f71430","resolution":{"observed_at":"2026-08-10T22:19:14.369517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.352987Z","title":"Vqa therapy: Exploring answer differences by visually ground- ing answers","venue":null,"work_id":"3cdb44ed-22c5-4cd6-b977-66813236f97b","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.558672Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:e113305912aa4c6ac29de41d17c79dcef7b640db4191a022a4686dd6c93f178a","observation_id":"5e6765d8-826e-47b3-9dcc-b2f0c189e2f7","resolution":{"observed_at":"2026-08-10T22:19:14.357473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.340963Z","title":"Fully authentic visual question answering dataset from online communities","venue":null,"work_id":"f4de39f7-2562-46a9-b930-bebc9a44a03d","year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.562069Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:bf6dae4740d2b58e2e1b84b6574470e05eb82c7b06d0b502bea1c2a24c0c0966","observation_id":"635550d4-1e76-413f-a77b-8615a1694fc8","resolution":{"observed_at":"2026-08-10T22:19:14.344905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.329316Z","title":"Cops-ref: A new dataset and task on composi- tional referring expression comprehension","venue":null,"work_id":"e88f771d-9812-4c66-aa7c-25b568478d86","year":2020},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.565125Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:ff3b0d82f4e887777d32e2bd039967cf902daf62a3e49afbe1778c8b995abbd2","observation_id":"011efa55-1d4e-4a66-ad1c-9fc2c1d88cf9","resolution":{"observed_at":"2026-08-10T22:19:14.333153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-10T22:19:13.568825Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.568825Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:57c7d74c0f91270a93efca0466df4732da3407091809e80d42c023d36aac3980","observation_id":"a0e3da99-d8f5-4681-a206-039167b74e9e","resolution":{"observed_at":"2026-08-10T22:19:13.568825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T22:19:13.573077Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.573077Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:ec029af87d710883a388e8ac6ab7609a8f420ed564d456aa424ef902e49a7327","observation_id":"9db10d44-fa89-48d2-a68f-fa6e216b624f","resolution":{"observed_at":"2026-08-10T22:19:13.573077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.02125","last_updated":"2016-09-26T04:08:19Z","snapshot_observed_at":"2026-08-14T22:02:37.556549Z","submitted_at":"2016-04-07T19:26:56Z","title":"Resolving Language and Vision Ambiguities Together: Joint Segmentation & Prepositional Attachment Resolution in Captioned Scenes","version":4},"cited_work":{"arxiv_id":"1604.02125","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.02125","snapshot_observed_at":"2026-08-10T22:19:13.891141Z","title":"Resolving Language and Vision Ambiguities Together: Joint Segmentation & Prepositional Attachment Resolution in Captioned Scenes","venue":"cs.CV","work_id":"e2945115-dae9-48d5-b0a3-b50b0a571e47","year":2016},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.577309Z"},"links":{"cited_paper":"/paper/1604.02125","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:058e1c33ac9f47028dcf320860863b6815cf57fdbb5466f01ea37def0822ade3","observation_id":"3a3bbdbb-24c3-47b5-93be-e98729387ccb","resolution":{"observed_at":"2026-08-10T22:19:13.895356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-10T22:19:13.581827Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.581827Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:fd47c97b545c1a3c61db41ea2b210321a6b92f93f4d2c9c74eabcaa36ed99b4f","observation_id":"b3bcbc7a-8ea3-4ab5-a549-b2e4cfcff3b4","resolution":{"observed_at":"2026-08-10T22:19:13.581827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.318548Z","title":"Zero-shot and few-shot video question answering with multi-modal prompts","venue":null,"work_id":"462f485c-45af-4a3a-8288-9831f58c135f","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.586224Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:3a5c68ce673dba1f2ce998bcc2829a7f44363dd6a5f73a22971fd03f91ee51bd","observation_id":"b1e47f0a-baf4-4de6-b1bf-343d711dfa2c","resolution":{"observed_at":"2026-08-10T22:19:14.321971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.307678Z","title":"Vqs: Linking segmentations to questions and answers for supervised attention in vqa and question-focused semantic segmentation","venue":null,"work_id":"fc85555e-3d4b-4c8f-bfcc-49e89cd1305f","year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.590122Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:27a5a468a77d5cf2eb914df4e64bf4e3e1f6c3fc65ca60b6211b3a90c95fa9e1","observation_id":"c48e1e52-e66b-416e-9b4d-6f96680ec71c","resolution":{"observed_at":"2026-08-10T22:19:14.311226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.296525Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"f01136f4-37ad-4afd-b004-3ceb178552c1","year":2017},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.593974Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:7b3ec0e5a42767518029592dcfefc73a7198ee34f29fd8276192035fc39939b0","observation_id":"853b4b89-a37d-4f41-8f87-377224909b5a","resolution":{"observed_at":"2026-08-10T22:19:14.300267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.597704Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.597704Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:ba1508f2bb848b669ad5377519cb53531e12d73553aff2d00bb845a6f672de98","observation_id":"34991dcb-c056-4db1-b3ab-d884437dda1a","resolution":{"observed_at":"2026-08-10T22:19:13.597704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.275206Z","title":"Abg-coqa: Clarifying ambiguity in conversa- tional question answering","venue":null,"work_id":"6074a36e-1cf3-48df-8c79-0d5928db45bf","year":2021},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.601696Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:c9399f8f79ed5fb8fc2fe8e64ad74b4aa2cc1bd9c79b190612d54af8d0e1b513","observation_id":"57477597-2063-4653-83f7-ad35ea92d844","resolution":{"observed_at":"2026-08-10T22:19:14.279047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.261097Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"d873738c-0d06-4243-a83b-4cca1fbd067f","year":2019},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.605590Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:04094e3f203efb6da75d4a77d81af698c96ab334310b9658641115f0fc730f95","observation_id":"57820aaf-2d32-4f42-b173-60d5980fc62f","resolution":{"observed_at":"2026-08-10T22:19:14.266509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.248822Z","title":"Crowdverge: Predicting if people will agree on the answer to a visual question","venue":null,"work_id":"11254a6b-f5ac-45a4-854a-a786f8bb113c","year":2017},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.610550Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:66fed46c5dc176d3ac4ab97bf9bb51d05894f40ce7631ecdf53c099abe2eb924","observation_id":"4201e5f5-1fef-4fd7-9c2b-d9caf787616d","resolution":{"observed_at":"2026-08-10T22:19:14.253575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.237640Z","title":"Gurari, K","venue":null,"work_id":"677566fb-39ea-4c0d-9294-60ec8e53a34b","year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.614613Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:9acd4516e63e4297b5fa94769bb7fa3b2c53d8c14102fc9178626e278366d7fe","observation_id":"2e105630-43e1-464d-b41e-f46e7fb7c367","resolution":{"observed_at":"2026-08-10T22:19:14.241375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.226255Z","title":"Predicting foreground object ambiguity and efficiently crowdsourcing the segmentation (s)","venue":null,"work_id":"c4f0e527-f32f-4ea9-890a-159ce364b3f8","year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.619382Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:6aac945a93aea8036fa3bfa5aa265795696a0730675739f7edd71a037bb34951","observation_id":"ea230c51-3467-41b8-9204-36ecdbb20ccc","resolution":{"observed_at":"2026-08-10T22:19:14.230175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.623315Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.623315Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:d6e8235e52269ff558cbd1e5a43c5e61de69337f404528de9129302a2be40e87","observation_id":"c4a3b52b-ac85-46c4-8ffb-64246d111d63","resolution":{"observed_at":"2026-08-10T22:19:13.623315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.206353Z","title":"A survey on instance segmentation: state of the art.International jour- nal of multimedia information retrieval, 9(3):171–189, 2020","venue":null,"work_id":"110f961e-2312-4354-810f-ace11ad2f8f2","year":2020},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.627755Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:feed4d27fea5c6f625d8b8ac813296709f160b1037e3fab3f91b05921a7b9c30","observation_id":"4804eaf0-a390-47bf-a4f2-ea42c7e351c2","resolution":{"observed_at":"2026-08-10T22:19:14.210965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.193787Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"94935e83-ac1b-4769-812e-df79148d453e","year":2019},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.631499Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:2b22d6847fa2ee6ca93aec051088cc6a27af13e130d1249b75c1427cfd65d7d6","observation_id":"8a8c6159-872b-4490-b94c-f1783ee6edfa","resolution":{"observed_at":"2026-08-10T22:19:14.197739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06303","last_updated":"2025-07-25T17:55:30Z","snapshot_observed_at":"2026-08-16T17:41:44.438639Z","submitted_at":"2024-08-12T17:15:02Z","title":"Long-Form Answers to Visual Questions from Blind and Low Vision People","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06303","snapshot_observed_at":"2026-08-10T22:19:13.635184Z","title":"Long-form answers to visual questions from blind and low vision people","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.635184Z"},"links":{"cited_paper":"/paper/2408.06303","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:5272d27f9ab0cd97e141f70a939e572f6d2f6d379312cdc01492a254372ffd05","observation_id":"a8dfdd65-a7c9-4e4a-b377-45a87af2f0c7","resolution":{"observed_at":"2026-08-10T22:19:13.635184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.181823Z","title":"Salient object detection: A discriminative regional feature integration approach","venue":null,"work_id":"66be3d66-fbaf-4579-ab8a-d431936c40e7","year":2013},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.639245Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:412b096cca6afa456d34b70317b29fc707d9cb83df4b69517a6b53182c5139e0","observation_id":"850fb64c-d769-4a76-ad0b-9fea91b5cc17","resolution":{"observed_at":"2026-08-10T22:19:14.185954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14696","last_updated":"2023-10-23T08:42:49Z","snapshot_observed_at":"2026-08-20T15:47:18.054948Z","submitted_at":"2023-10-23T08:42:49Z","title":"Tree of Clarifications: Answering Ambiguous Questions with Retrieval-Augmented Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14696","snapshot_observed_at":"2026-08-10T22:19:13.642999Z","title":"Tree of clarifications: Answer- ing ambiguous questions with retrieval-augmented large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.642999Z"},"links":{"cited_paper":"/paper/2310.14696","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:d65acbd8eb0e0a9af12b7468825ee34fed48ff9e335f1dc9861d5554bdda056f","observation_id":"46eb0406-f91b-444f-8b4c-68b9d3653621","resolution":{"observed_at":"2026-08-10T22:19:13.642999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.169295Z","title":"Segment any- thing","venue":null,"work_id":"766c401a-55fc-4844-bd5c-69229a9f9846","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.646478Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:daef2001f7299aaf0dcae1f57a5164aaebd7ba2b5fa5ae0ccabdb56b92d12610","observation_id":"3c97303a-e98f-4b4f-9231-252b696bc887","resolution":{"observed_at":"2026-08-10T22:19:14.173503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.157437Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"e21c62ef-d564-481f-b34f-b3d85a43880b","year":2017},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.649803Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:2ab6315b657d886ef8f00b29eb069d2f89fbd34f1a86abab4a2d78d742f91283","observation_id":"4f380e9f-5f23-40d4-8959-86a1e95516b4","resolution":{"observed_at":"2026-08-10T22:19:14.161421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T22:19:13.652557Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.652557Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:5818e842eef75c990034c495d2b63dc9767635317cef51042f1313881fbc1795","observation_id":"496ad413-1645-422f-8535-747f1edabc8f","resolution":{"observed_at":"2026-08-10T22:19:13.652557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.655515Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.655515Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:a793ca8fddcc13bd8f7d84330f8f45a8b1a2a9f67e32457e2d3bb0c6f8d85bf0","observation_id":"6195d37c-5db3-4e36-a8d1-09fe210799ee","resolution":{"observed_at":"2026-08-10T22:19:13.655515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.137844Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"3893ab0d-9904-411a-8f1a-de9e2f7c9f5d","year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.658380Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:a83463b38e1ac107ecddc8c684d048f5d3cf50f6e286279e8dd1dbf1e444df88","observation_id":"214bc35a-d889-44c9-9e38-7e83f092d068","resolution":{"observed_at":"2026-08-10T22:19:14.142335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.126609Z","title":"Learning to detect a salient object","venue":null,"work_id":"06e62a6e-c596-46c3-99c0-85cb479eb981","year":2010},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.661432Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:339fe5360b9bde4ae8eefe56d2507854876b8c0f2ef76363dfa835698bdebaff","observation_id":"0905dfff-9a34-430b-85ea-f7fd155a9d64","resolution":{"observed_at":"2026-08-10T22:19:14.129885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.115579Z","title":"Storytelling with image data: a systematic review and comparative anal- ysis of methods and tools","venue":null,"work_id":"87264512-a7a7-4b9d-9a68-5eea3585fc84","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.664520Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:33be2031dbb7a818ec9c041076871817a51f79041b8320062ba06d68cea88c42","observation_id":"34b8eedb-3687-4a2e-be56-31c07a7ade74","resolution":{"observed_at":"2026-08-10T22:19:14.119089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-10T22:19:13.667579Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.667579Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:c98534d81845af8dbbf57c48193e9f56ace511f6372c4032acbdee43a932a4ad","observation_id":"efe7ec67-707a-43b3-a622-7daad9b8fd6c","resolution":{"observed_at":"2026-08-10T22:19:13.667579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.104427Z","title":null,"venue":null,"work_id":"7c2d2409-5741-4828-ac83-befe7ba68b35","year":2021},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.670906Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:2f0dad7b6facb426aa0b14e71a696a113da338bafc3d0892ee62d6188f78bd20","observation_id":"62494ba0-6807-4115-b024-579d2c88284d","resolution":{"observed_at":"2026-08-10T22:19:14.107800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.093236Z","title":"Resolving ambi- guities in text-to-image generative models","venue":null,"work_id":"9ba66f51-e56f-45f7-b7b7-f141956cb756","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.674226Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:541b3b23d61ecbfbba4ae8f37990a78f37414a38a50cae663fb3d9619f5aac4d","observation_id":"90ee9174-dae7-4426-a98c-5ab9c659b7c8","resolution":{"observed_at":"2026-08-10T22:19:14.096850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10645","last_updated":"2020-10-05T03:28:21Z","snapshot_observed_at":"2026-08-10T00:47:33.544216Z","submitted_at":"2020-04-22T15:42:13Z","title":"AmbigQA: Answering Ambiguous Open-domain Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10645","snapshot_observed_at":"2026-08-10T22:19:13.677458Z","title":"Ambigqa: Answering ambiguous open-domain questions","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.677458Z"},"links":{"cited_paper":"/paper/2004.10645","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:ddf679db9390b6cc2ccc72d7c44d0b4ca6134bd654cbb8701ca1850b92d286e5","observation_id":"08c67028-1705-4d05-aad9-e061034f6e0f","resolution":{"observed_at":"2026-08-10T22:19:13.677458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.080339Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"e35ebcee-2680-4ee3-9c8f-8bc53d911118","year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.680844Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:741ba4178ad5a129c3d4e5e122b45ca7724b028be75af305f00acde31d933399","observation_id":"68e0eab0-52e4-4a67-ac79-734c16adcc21","resolution":{"observed_at":"2026-08-10T22:19:14.084045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05861","last_updated":"2024-04-02T17:37:42Z","snapshot_observed_at":"2026-08-16T14:53:45.217936Z","submitted_at":"2023-10-09T16:57:57Z","title":"Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2310.05861","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05861","snapshot_observed_at":"2026-08-10T22:19:13.805019Z","title":"Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models","venue":"cs.CL","work_id":"c785cc8e-d2e0-4f6a-b89a-06f6f0c117bc","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.684378Z"},"links":{"cited_paper":"/paper/2310.05861","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:213540b17b665ab2236288ba6904157155d30bf8ccbf0498dba5de7a6f217ec8","observation_id":"363dfbcc-f442-458a-8e2a-924e39ddd723","resolution":{"observed_at":"2026-08-10T22:19:13.812809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.687703Z","title":"Referring ex- pression comprehension: A survey of methods and datasets","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.687703Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:337b1529ddd11fe88b05c5b1ec472f5e17f718515e9d4dc7b67ffd672564cc26","observation_id":"8ac7ffbb-b468-47b6-a20f-8cf67585aa3d","resolution":{"observed_at":"2026-08-10T22:19:13.687703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01795","last_updated":"2023-01-04T19:28:03Z","snapshot_observed_at":"2026-08-16T16:04:23.135961Z","submitted_at":"2023-01-04T19:28:03Z","title":"PACO: Parts and Attributes of Common Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.01795","snapshot_observed_at":"2026-08-10T22:19:13.690739Z","title":"PACO: Parts and attributes of common objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.690739Z"},"links":{"cited_paper":"/paper/2301.01795","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:f8687a01fb0b38ffe90719a313de75b79767f653c215bac6dce488682c703a42","observation_id":"17a8c0ae-0a7f-49ab-9e1b-da757aca4039","resolution":{"observed_at":"2026-08-10T22:19:13.690739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.060371Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"590b0541-6f3a-4180-8037-f165b2732888","year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.694329Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:91e9096411ea55ea26962a39755385af7f09688c18030b50aec09fd3e4ba340a","observation_id":"f89d040e-cef8-4fca-91b0-56061121aa2d","resolution":{"observed_at":"2026-08-10T22:19:14.064636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.047749Z","title":"Omnilabel: A challenging benchmark for language-based object detec- tion","venue":null,"work_id":"ea3241c0-def5-4ade-90e3-0fbb7c25ea8f","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.697717Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:6859f7cf2950f5e17158424d08dcec43ddc03da8a92f7671d570dd927c0ee022","observation_id":"8703932d-f850-43e4-bead-c0062f26aa38","resolution":{"observed_at":"2026-08-10T22:19:14.051910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.701194Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.701194Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:3ec5c0d5512e32dce8cde77459572fbea022e51c3ffa75218b89773d5e2d61c5","observation_id":"89234697-5ee6-4e6b-a4a6-91a9535ebb22","resolution":{"observed_at":"2026-08-10T22:19:13.701194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07516","last_updated":"2023-06-01T19:19:23Z","snapshot_observed_at":"2026-08-16T16:16:19.497581Z","submitted_at":"2022-11-14T16:45:42Z","title":"Why Did the Chicken Cross the Road? Rephrasing and Analyzing Ambiguous Questions in VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.07516","snapshot_observed_at":"2026-08-10T22:19:13.705234Z","title":"Why did the chicken cross the road? rephrasing and analyzing ambiguous questions in vqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.705234Z"},"links":{"cited_paper":"/paper/2211.07516","citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:17498946a569f1250fe6c58de3f03e1eb81bec568b34945595e1358a1ed11740","observation_id":"26e534b9-9523-48a3-87ec-8384c4fb2e41","resolution":{"observed_at":"2026-08-10T22:19:13.705234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.029768Z","title":"Vizwiz- fewshot: Locating objects in images taken by people with visual impairments","venue":null,"work_id":"3282be22-cc8f-43f8-935b-5783db04b5e8","year":2022},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.709388Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:1a48c814c53ab2fca60efb2672db606e11e0a2fde0344a4ca84aca61c6e396ee","observation_id":"16b95603-233b-4b4e-b1fd-20410e912d07","resolution":{"observed_at":"2026-08-10T22:19:14.033908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.713405Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.713405Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:47879a54513437b93a5415a76be658aa1f6c9f129c72df4c272b0394b2204534","observation_id":"81489aa4-755b-4d24-a8a7-cfc60c850f1f","resolution":{"observed_at":"2026-08-10T22:19:13.713405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:14.010750Z","title":"Modeling ambiguity, subjectivity, and diverging viewpoints in opinion question answering systems","venue":null,"work_id":"673ebfed-2b09-4cfc-a41b-b6f71b63ef6f","year":2016},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.717524Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:b4ee865b0d3a4c433fd5312142c7599edd05f73bdad0277718f2849bc383e3d9","observation_id":"4f352b30-78d1-430d-b580-002d3179c707","resolution":{"observed_at":"2026-08-10T22:19:14.014872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.998515Z","title":"Twice opportunity knocks syn- tactic ambiguity: A visual question answering model with yes/no feedback","venue":null,"work_id":"bc05fad5-3e9f-4b62-8c74-af4d9faf253e","year":2019},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.721701Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:ae9f8557116448b1a7b14e9927ffe9731de5159089d7864932b153e43ca5cf3a","observation_id":"56d6c376-c0e8-454a-ac1a-41bbf5954e86","resolution":{"observed_at":"2026-08-10T22:19:14.003034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.986872Z","title":"Phrasecut: Language-based image segmen- tation in the wild","venue":null,"work_id":"044407bb-f34d-4de1-8883-3efcd7920d8f","year":2020},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.725793Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:e0fd43c606bb6e88cda54a243c3974a563a148851a3af724dc9065bcc1f29731","observation_id":"852d83ff-f24c-45f9-9e45-2afa099396b3","resolution":{"observed_at":"2026-08-10T22:19:13.990856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.976012Z","title":"Described object detection: Liberating ob- ject detection with flexible expressions","venue":null,"work_id":"e4c88042-2ea3-4fe4-8504-21e555a0dd8b","year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.729933Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:d30ce3c5001eb3a134fba604731faaab21eea738305914cf9ff2074eb25b9224","observation_id":"f4dde751-9126-4443-b133-09ec9b1cb4a7","resolution":{"observed_at":"2026-08-10T22:19:13.979253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.965402Z","title":"Visual Question Answer Diversity","venue":null,"work_id":"e1121615-8d0a-47f3-a972-7d5af56a5e3c","year":null},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.734248Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:84bbbf4f10b7d00c1c9b644016028a69febbf76d053af2c8aa64eb6d2237daad","observation_id":"5902d523-5713-4fa4-9500-9c8fb9168a77","resolution":{"observed_at":"2026-08-10T22:19:13.968710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.955325Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"73cc0bd0-1d47-4ddf-b93c-4d868df5c3ff","year":2024},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.737940Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:7851acac091604e4155744bc582c2f6355ef2208360a59daab1069668b81e6c9","observation_id":"ee429aa1-a11f-433e-80bb-e867be02b912","resolution":{"observed_at":"2026-08-10T22:19:13.958709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.945231Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"0bd0e0c2-e233-40f3-8be4-21c0248e6220","year":2016},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.741831Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:faa238562d613dce4765b3237074a2ea51e80f98628ae5c893ffb188b1959939","observation_id":"a186a13f-58b5-47e7-9f24-1900437161c8","resolution":{"observed_at":"2026-08-10T22:19:13.948491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:13.934476Z","title":"Object detection in 20 years: A survey.Proceed- ings of the IEEE, 111(3):257–276, 2023","venue":null,"work_id":"45a63f38-13b7-44c2-a969-e8668fe92bb9","year":2023},"citing_paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:13.746242Z"},"links":{"citing_paper":"/paper/2501.02201"},"observation_digest":"sha256:14718948574bbe613a2c550a8a10c607a5c40a6185eb7a90258ad86464b6ec85","observation_id":"e400f1b2-23e6-428f-ab94-f5cd58c9e832","resolution":{"observed_at":"2026-08-10T22:19:13.938505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.02201","last_updated":"2025-07-31T08:02:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T05:37:33.971856Z","submitted_at":"2025-01-04T05:36:11Z","title":"Acknowledging Focus Ambiguity in Visual Questions"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2501.02201."}