{"as_of":"2026-08-14T07:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:946dc926255f2b7ab90f7468298a3686fae5c4e1918d7d1550e80c0ce533bbc2","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:24:58.878977Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07801/citation-record","integrity":"/paper/2412.07801/integrity","json":"/paper/2412.07801/citation-record.json","paper":"/paper/2412.07801"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T20:24:58.425030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.425030Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:9e981f84b78ad7536afc45101c235d27177d1c92e2a060128c5ea9eaea41390a","observation_id":"790c8798-03d9-4504-8ccf-54d08e7bf072","resolution":{"observed_at":"2026-08-11T20:24:58.425030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.904491Z","title":null,"venue":null,"work_id":"51156bcc-4ada-41f6-a954-dfb4381c3481","year":1956},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.432063Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:344a07d5b325f72889239261b6056a1d011d8ac147127c2e93676e9622227030","observation_id":"5f70e656-8f4c-4dee-b14f-8d411bf6034f","resolution":{"observed_at":"2026-08-11T20:24:59.912891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00784","last_updated":"2024-04-27T01:53:39Z","snapshot_observed_at":"2026-08-13T05:12:13.764151Z","submitted_at":"2023-12-01T18:59:56Z","title":"ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00784","snapshot_observed_at":"2026-08-11T20:24:58.437445Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.437445Z"},"links":{"cited_paper":"/paper/2312.00784","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:0ea1abf84c99800d6510eb23f05b25e9bcdc52599fa6269669dbfaf0150d535f","observation_id":"2f475124-5557-4af5-bb86-cc9b4615103b","resolution":{"observed_at":"2026-08-11T20:24:58.437445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.884759Z","title":null,"venue":null,"work_id":"05466140-ac91-471f-8a12-8bd5ef40c399","year":2024},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.443735Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:a7420dca2f34111ad84634ffc0c505a8008ec5d77f737ea4609d89ec14e46c25","observation_id":"50808cd6-637b-4b00-b114-59b3415bfc99","resolution":{"observed_at":"2026-08-11T20:24:59.890233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T20:24:58.449192Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.449192Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:371a63a9e920a0a441eb8e9adb6f42269d77c5eb5257463e2d149f715312abe9","observation_id":"64141e42-e463-4479-b6a4-2716bd41526f","resolution":{"observed_at":"2026-08-11T20:24:58.449192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04901","last_updated":"2023-11-08T18:59:05Z","snapshot_observed_at":"2026-08-13T05:29:38.625159Z","submitted_at":"2023-11-08T18:59:05Z","title":"GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEs","version":1},"cited_work":{"arxiv_id":"2311.04901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04901","snapshot_observed_at":"2026-08-11T20:24:59.154802Z","title":"GENOME: GenerativE Neuro-symbOlic visual reasoning by growing and reusing ModulEs","venue":"cs.CV","work_id":"f5bccd1f-f131-4c02-be11-245fb9a451b4","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.455119Z"},"links":{"cited_paper":"/paper/2311.04901","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:b453571b96d3cd45dc3ebde2fc9848063228fce4c32b81cb674dd349fa3ac6c0","observation_id":"25bb44e0-9842-43f0-933c-c4a146ef482a","resolution":{"observed_at":"2026-08-11T20:24:59.162779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.864677Z","title":null,"venue":null,"work_id":"b2dce00a-1d85-4248-bc11-cda45c082612","year":2019},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.461139Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:a54fa58721a2ecd919dd711b823e11152ca2e71fc25c44b63331fcd749e15c28","observation_id":"14514065-53ed-4e80-b78f-e4e6c592e48f","resolution":{"observed_at":"2026-08-11T20:24:59.870771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.846544Z","title":null,"venue":null,"work_id":"0c9a5523-32ba-4d92-b393-2bc9e0ea54cc","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.466405Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:13bb47df92310f0d15a90f3498c41f75731918823d92d05cd7e027751bdb73f9","observation_id":"7cbac773-d4e2-42f8-afae-c86776802ae5","resolution":{"observed_at":"2026-08-11T20:24:59.852174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.829221Z","title":null,"venue":null,"work_id":"1f994779-df0b-43c8-bc31-2975f517f757","year":2017},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.471729Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:78334ef54f282ad076e6a0c188f39ac2d2942fc7e8120422462fa02811ac5f94","observation_id":"c75d2430-ec6c-4cc6-b6be-829c22d2981d","resolution":{"observed_at":"2026-08-11T20:24:59.834968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.477261Z","title":"Denkowski and Alon Lavie","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.477261Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:d8ceb325b76d6dda0931348bbbd38493c40a890b8a181d43e89ca80bd392e30a","observation_id":"2b4a1ef3-f18e-4459-9032-739ecd622e59","resolution":{"observed_at":"2026-08-11T20:24:58.477261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.800245Z","title":null,"venue":null,"work_id":"1a977aca-d02e-4b0c-911a-254425bc089a","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.483277Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:72a968e642a6be0ea05c64311302356cc36c9c6b7fa9c2e91d14b5a86a3a090a","observation_id":"e8d675cc-9123-4acc-a8df-805490dd1721","resolution":{"observed_at":"2026-08-11T20:24:59.805873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.781409Z","title":null,"venue":null,"work_id":"d57e5d55-7f19-469a-b8c9-47ab22ed7776","year":2021},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.488805Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:072326f6fab1c85e7c914a870248f9ee8959f69e9c405a0822631e7a2675eca2","observation_id":"921dcef8-081a-49bf-9a5b-be5f7f332ebf","resolution":{"observed_at":"2026-08-11T20:24:59.788164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.763689Z","title":null,"venue":null,"work_id":"4baec084-6748-424a-ae84-5270312856c0","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.494049Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:be93ad4d3393387eee6529e5ad7a7338308a523989d2a689878aee16aceb343c","observation_id":"0c246101-6ba5-4600-9a40-97bc84ac60f4","resolution":{"observed_at":"2026-08-11T20:24:59.768801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.746796Z","title":null,"venue":null,"work_id":"f074964c-e250-4167-922a-ef442d4913b7","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.499232Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:3d2e91dd7d7439d7507986b58de3fb89dc8d35627cad3436b8e72ad29e312c91","observation_id":"4a4be01c-0529-4f1b-8028-7f285b9dcad2","resolution":{"observed_at":"2026-08-11T20:24:59.752058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.504570Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.504570Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ee0dcbc2b5a6f930ee352c41cf7ebb0eaddfec032270646e03aeb4f71ab07a88","observation_id":"ab8ed105-1b73-4b39-8582-0dd4bd5aaf06","resolution":{"observed_at":"2026-08-11T20:24:58.504570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.701586Z","title":null,"venue":null,"work_id":"2337c7e8-a19b-4c51-a010-9934ab294da8","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.514362Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:5bdc479ff14b0a0150ec918849c99160461b0393385c2399781ff7cc44402ec9","observation_id":"2a2eda67-9a97-492b-9ad3-1329bd7da263","resolution":{"observed_at":"2026-08-11T20:24:59.706687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-13T05:02:31.052003Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-11T20:24:58.519379Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.519379Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:d194172de3ee3c53c9f164a637cc0069dab0fd97b6fc0441326c89977132b96f","observation_id":"5cd10cf0-7fe7-494e-be3d-dfe74bc85bc4","resolution":{"observed_at":"2026-08-11T20:24:58.519379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.524903Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.524903Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:aef9807088ccdbd2353e03aa6e7015111c9e46b2416a4e1cd3c779313b513e04","observation_id":"20c3ee62-04a4-4089-88a9-0f4cce49eba9","resolution":{"observed_at":"2026-08-11T20:24:58.524903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.672384Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"c292d42b-db78-4242-8387-6731d2633c00","year":2015},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.530194Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:f6b13357e34af0f02a88ad09005478690f62d9e6f20578b77e17aad28eccc364","observation_id":"275dea9a-0215-4473-8986-030724ec4b2d","resolution":{"observed_at":"2026-08-11T20:24:59.677780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.655028Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross B","venue":null,"work_id":"4407bb97-0c70-4b1e-a6bc-9da88434870d","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.535090Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:98db7115c436dec8884eef2daeec6d711f3110c292d07feff2b60db70eccf4ba","observation_id":"dc654adf-42e8-4256-a4aa-0f3a353552ba","resolution":{"observed_at":"2026-08-11T20:24:59.660576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03354","last_updated":"2023-11-06T18:59:44Z","snapshot_observed_at":"2026-08-13T20:42:14.896445Z","submitted_at":"2023-11-06T18:59:44Z","title":"CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03354","snapshot_observed_at":"2026-08-11T20:24:58.539838Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.539838Z"},"links":{"cited_paper":"/paper/2311.03354","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:14f640fd7f8b46c527245d6fd3592f02da70dd71c9ea505fb55faf599c0fc936","observation_id":"cac99366-4373-490d-94e6-68415c833b96","resolution":{"observed_at":"2026-08-11T20:24:58.539838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.637699Z","title":null,"venue":null,"work_id":"dd39f7a5-6ecc-4291-859c-af55967455cd","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.545315Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:7fed3a319674876de0677cb5d26418f9d54897d2b5ae851d7c82a3f0cf9d33bb","observation_id":"2d0da285-c109-47aa-b918-2fd9c7eda274","resolution":{"observed_at":"2026-08-11T20:24:59.642935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-13T11:22:39.882259Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-08-11T20:24:58.550719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.550719Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:a961154ad7688f1e48da464a43650c9778415daddae2888f4c380436d1f8872b","observation_id":"1559abe1-c76a-49ce-9955-1af00bb34dcc","resolution":{"observed_at":"2026-08-11T20:24:58.550719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.620710Z","title":null,"venue":null,"work_id":"3a0d5d7e-3f1d-41de-a967-30c75d15ab1e","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.555914Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ca7dbcf9a1338f389c03805ef6ba5dc45c048a4e4339aa015f109025b93752fc","observation_id":"658d37c1-7d72-4eff-9f20-939bb47d544c","resolution":{"observed_at":"2026-08-11T20:24:59.626229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.561013Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.561013Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:786f2229336217defa2424096faa179793ceabf78d9df5f45c43d1f4f203ca21","observation_id":"e70dd1b7-839c-484c-a383-85e087db8037","resolution":{"observed_at":"2026-08-11T20:24:58.561013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.567517Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.567517Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:b3928b23140c6ec42f6b2cbf3042f6a87959a6011ca690af4b41a4e40b35c5d5","observation_id":"5f0dfb67-64ca-40b6-b389-a738aae19a75","resolution":{"observed_at":"2026-08-11T20:24:58.567517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.578527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.578527Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:0fc8a7f97eee9256d1d9d14976d355a59ae292c1ecabfde5ff7b8175306d60a6","observation_id":"92e8eab5-74f5-476a-ad56-5fe9422b1f8c","resolution":{"observed_at":"2026-08-11T20:24:58.578527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.571328Z","title":null,"venue":null,"work_id":"e5e19ac5-f327-4c81-8d80-f0c200e3de34","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.584012Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:063ebe005114813b650ceafd9047793f7782bc15fb2fd4f144fea3ea1c0168cd","observation_id":"899be0ed-b6eb-4741-baf5-e4c880407304","resolution":{"observed_at":"2026-08-11T20:24:59.576349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.554440Z","title":null,"venue":null,"work_id":"b60092ac-84db-462e-8b74-8f8a794649f1","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.591364Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ec18dc0bca68280889677e0a2dea719f9d1b607fa7ad8e7206250d59e2763c9f","observation_id":"85752bf9-44d1-400a-8af0-f1ce44d17d44","resolution":{"observed_at":"2026-08-11T20:24:59.559580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.596247Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.596247Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c907a5d8e382227c6fa3040bf6568992755bde22358506d0559ab7dc3824e0b4","observation_id":"18b32937-f368-4a53-9a9a-b89f76acc998","resolution":{"observed_at":"2026-08-11T20:24:58.596247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.507131Z","title":null,"venue":null,"work_id":"ca8fdec3-d4d4-42ca-a2e2-45c57b534e36","year":1930},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.607320Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:6aae5c7efaf21ec52463e933a457a9f92645e30fc04d5b8bef387d95f103c53e","observation_id":"73aa19b9-73fc-4f89-9d2a-d2d2160581a6","resolution":{"observed_at":"2026-08-11T20:24:59.512461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:24:58.612361Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.612361Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:e3b953a7488d9c68946a5bee98a26714a5468e1c645b79a8a7d436a75046bab2","observation_id":"45596e47-4c02-413e-9243-713085d537eb","resolution":{"observed_at":"2026-08-11T20:24:58.612361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.617162Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.617162Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:710e42d44d877c6aa33442370401bb4658b23a5a5ad6db3e213de0a022bb8112","observation_id":"0a27c4ff-5407-4580-bdae-a687dee04113","resolution":{"observed_at":"2026-08-11T20:24:58.617162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.622124Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.622124Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ec08d0400753395d9717c65ae1b509c806d35adbfc79fdf46e3be89c0e5491bc","observation_id":"e35e6e2f-2904-4124-b73d-2d1bac1c03eb","resolution":{"observed_at":"2026-08-11T20:24:58.622124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.628076Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.628076Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:887e3882b42fe9e1faf8d5eef8c0a50779b27d1d45dac24386c5509b59e6fdce","observation_id":"fb109178-c86e-4de6-80c4-3d6bf72b8017","resolution":{"observed_at":"2026-08-11T20:24:58.628076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.633094Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.633094Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:56e56279b77ffdae5cc026f3182255096646a3d3b594ffe2b3d3112105b07d6a","observation_id":"8358eb97-4623-42e2-b989-7051911c20c5","resolution":{"observed_at":"2026-08-11T20:24:58.633094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.443326Z","title":null,"venue":null,"work_id":"ca977699-d9a2-4ac9-a75e-492deb797844","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.638435Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:14582008345e81dcce9b92adc5474e3e554e2ab43b3fc5e5eff23ac490ec8d23","observation_id":"6424e198-e2c7-418c-86e2-855ccba0433c","resolution":{"observed_at":"2026-08-11T20:24:59.448624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.425244Z","title":null,"venue":null,"work_id":"3e56ee32-4906-41ec-a94c-c9e983eb21b5","year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.652694Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c59b06a60da58dae097463232f9fb5d2af6b25f81ed1d72bbd559606221b79b6","observation_id":"2a559d22-4788-4c81-b787-7c5fb0c10e7d","resolution":{"observed_at":"2026-08-11T20:24:59.431049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.407897Z","title":null,"venue":null,"work_id":"f3f6bb59-f969-47a4-a457-a972f5d03cff","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.658409Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:6d7c35aa4a69c0b95bc34d1ed149534a712b384595f64f784b6d3f133f3842ca","observation_id":"98814e1e-44ec-4f97-841f-6b14c74d8177","resolution":{"observed_at":"2026-08-11T20:24:59.413661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.664257Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.664257Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:dd71d409a998640abd4ed70d0cedbfd209617291f4d04a2bbaaf70c26840a594","observation_id":"3b4f40bd-4e49-4f1e-9203-9cec805033f2","resolution":{"observed_at":"2026-08-11T20:24:58.664257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.377956Z","title":"Kankanhalli, and Ying Shan","venue":null,"work_id":"5708c340-1f5b-48b8-8a77-d04e62c702cd","year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.669366Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:de019b4d2e874ec8ff52409be528eb2cc2bbaae02d1921ff8fa6f59f196f2c78","observation_id":"661fd402-cf8b-4853-80bd-820896e41528","resolution":{"observed_at":"2026-08-11T20:24:59.383000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.358856Z","title":null,"venue":null,"work_id":"17831e47-996b-40d7-8e13-3fd0557c1f78","year":2024},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.680935Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:08061b14969a91a142f28da9d9d3c81d3993d712f0219f8560c3e152c3712a37","observation_id":"d15a06d4-e799-4897-a780-7458765aaaa4","resolution":{"observed_at":"2026-08-11T20:24:59.365071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00582","last_updated":"2024-03-13T03:42:31Z","snapshot_observed_at":"2026-08-13T06:00:02.329177Z","submitted_at":"2023-10-01T05:53:15Z","title":"Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00582","snapshot_observed_at":"2026-08-11T20:24:58.685925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.685925Z"},"links":{"cited_paper":"/paper/2310.00582","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:289affb78dfd0f17ff09f6b0bae8a289c4f99f533823d992512300546b6d1de7","observation_id":"cb5ab899-8ab8-4bbd-ae0c-3ee6451b5a07","resolution":{"observed_at":"2026-08-11T20:24:58.685925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.341186Z","title":null,"venue":null,"work_id":"51853e03-4a05-4acc-80ed-1c165754f965","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.691231Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ada15dd114f365c9d093551380d2a802b2886d37c7ac1b639f10a12012954923","observation_id":"fd484882-c148-41c8-b67d-40d76d1fa519","resolution":{"observed_at":"2026-08-11T20:24:59.346314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12223","last_updated":"2023-05-23T10:35:35Z","snapshot_observed_at":"2026-08-13T11:38:11.144651Z","submitted_at":"2023-05-20T16:11:26Z","title":"What Makes for Good Visual Tokenizers for Large Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12223","snapshot_observed_at":"2026-08-11T20:24:58.675146Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.675146Z"},"links":{"cited_paper":"/paper/2305.12223","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:497e97c6d8492ca7a63c1a15a42f7306914da17e2daf5807132c6822fa69dd42","observation_id":"5f8b5b5d-3e08-4d43-bdc5-0879d0161b8f","resolution":{"observed_at":"2026-08-11T20:24:58.675146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.305305Z","title":"Ayyubi, Kai-Wei Chang, and Shih-Fu Chang","venue":null,"work_id":"51ebff24-7cff-4f4f-91a1-28d7d94fc77f","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.700943Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:08b47073223858a837b2f16175066a8a00be07cb50e0bd5030acfafa26dd6044","observation_id":"fb334b67-d093-4dc0-8155-14073405c3bd","resolution":{"observed_at":"2026-08-11T20:24:59.310859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00653","last_updated":"2023-10-01T12:35:18Z","snapshot_observed_at":"2026-08-14T05:35:37.531059Z","submitted_at":"2023-10-01T12:35:18Z","title":"Reformulating Vision-Language Foundation Models and Datasets Towards Universal Multimodal Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00653","snapshot_observed_at":"2026-08-11T20:24:58.819520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.819520Z"},"links":{"cited_paper":"/paper/2310.00653","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:71b4a50ef9ce9384fa67b8a7e0b2b1dac4cb34b22b751c41d5dbe37417842598","observation_id":"c745772d-88be-4c47-9f00-6d7516d1e0ac","resolution":{"observed_at":"2026-08-11T20:24:58.819520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.287956Z","title":null,"venue":null,"work_id":"84583251-fd96-4264-b10d-4fc88bf82512","year":2024},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.826900Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:af6a8497e2fd782ec8043b5de809451accb287f6b8cac5e0c413488d2215484b","observation_id":"7ba0b754-53b1-4a16-bd0b-6fdd386e90ca","resolution":{"observed_at":"2026-08-11T20:24:59.293250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.323517Z","title":null,"venue":null,"work_id":"64bc1e2b-538b-4a9e-b142-1c15d014f163","year":2021},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.696033Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c3b0d557c5ee3a9879888ada1519093f950c799b023784e0c2a06465d11b1dd7","observation_id":"67d6d895-47bf-4a39-88b2-db5422dea2cc","resolution":{"observed_at":"2026-08-11T20:24:59.328569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T20:24:58.837882Z","title":"Diab, Xian Li, Xi Victoria Lin, Todor Mihaylov, Myle Ott, Sam Shleifer, Kurt Shuster, Daniel Simig, Punit Singh Koura, Anjali Sridhar, Tianlu Wang, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.837882Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:ab1e9407b867dbe9ef764335b13a866e4f9351d3ddb4ec0af089644bc4d59e14","observation_id":"84d5fe19-58d6-4f46-b6a7-9cd03a16486e","resolution":{"observed_at":"2026-08-11T20:24:58.837882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-13T11:00:14.993256Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-11T20:24:58.844630Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.844630Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:e190c260ed7841fe080327699b2ff42c1390eda01a9b0fe6943a2fbfa42f263d","observation_id":"a16ae891-0baf-4145-8f8e-0a7d0392063d","resolution":{"observed_at":"2026-08-11T20:24:58.844630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.850385Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.850385Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:f974c3411beb50a5b7dc0281a9e4d4d5d813a9da4d11b82852f4c53feaae6d8d","observation_id":"d0c59df3-acdc-4d25-ac16-82ea52769aa5","resolution":{"observed_at":"2026-08-11T20:24:58.850385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.271196Z","title":null,"venue":null,"work_id":"7ceb042d-d0dc-4062-92bf-4324b2df9a0e","year":2019},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.832063Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:6a6947b04b386c0fe1f554c49cb13667c4e6b40f9c830223b356bba06171e750","observation_id":"826fa3e5-5fbf-4389-a03a-10c4e5a07c94","resolution":{"observed_at":"2026-08-11T20:24:59.276307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T20:24:58.878977Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.878977Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:c05966ce1d3d190003f13a1921f3c0d39e1ca64a5352593087cfd03c4f08481d","observation_id":"73dd64b0-0ded-4a0d-aac0-6bdf35f7e186","resolution":{"observed_at":"2026-08-11T20:24:58.878977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.230961Z","title":null,"venue":null,"work_id":"3049a0e3-e059-47e8-bf43-e48146b900eb","year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.872814Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:e50d82b30622840420c9c803079291b0ba8fa44dff4ae70875a6ea9e813da4af","observation_id":"994332af-eec7-4c7e-a971-0961649be99b","resolution":{"observed_at":"2026-08-11T20:24:59.236382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.718213Z","title":null,"venue":null,"work_id":"04d21361-c063-4a53-b47c-e8813e96bb25","year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.509413Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:aa8eae098d1f604db83dfa928bd1b6fb8cada7d83d43271fdd88f7885504019f","observation_id":"af7f7e36-a677-412c-8066-db74d0dc4c62","resolution":{"observed_at":"2026-08-11T20:24:59.723819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:59.524746Z","title":null,"venue":null,"work_id":"fdea57a0-7db0-4367-b43f-3dfd338bf642","year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.601703Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:59be1666fdeaae5fdd910a944a041a12d0a055571348517b214934eb02903dc9","observation_id":"ad44c32a-daef-4099-b1aa-4ca1aceebf03","resolution":{"observed_at":"2026-08-11T20:24:59.530414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:24:58.866954Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.866954Z"},"links":{"citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:2395d182abec3367edefdca0f5400caf270ef09c882be0eacb7356c4baa95ee0","observation_id":"8149cf16-f880-48be-9d9e-419465951581","resolution":{"observed_at":"2026-08-11T20:24:58.866954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-11T20:24:58.572985Z","title":"CoRR abs/2306.14565 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:24:58.572985Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2412.07801"},"observation_digest":"sha256:d4426214f2bd30b33ae5ca86a2b0b9c86e48bd14130c095b4b739480fcac2bf3","observation_id":"4719f194-a45e-48b3-b66b-7c09617c7783","resolution":{"observed_at":"2026-08-11T20:24:58.572985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.07801","last_updated":"2024-12-08T03:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T02:39:12.224910Z","submitted_at":"2024-12-08T03:59:59Z","title":"Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2412.07801."}