{"as_of":"2026-08-12T13:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf709c8d1a8ca987168f7f83be96521f4dc9cbeeab518d890152e6afcc619cf8","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:22:29.090022Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.08771/citation-record","integrity":"/paper/2501.08771/integrity","json":"/paper/2501.08771/citation-record.json","paper":"/paper/2501.08771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.080200Z","title":"Bilinear attention networks,","venue":null,"work_id":"c76b166d-d86a-42d6-8da3-ac1ff30e6010","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.815676Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:eaed13b5e18af0f2e27e0a2d139c2eecd320cce9bbf4b6f15bc697ebf1b8237c","observation_id":"9532b078-bd9d-472e-8895-c0dcacd07458","resolution":{"observed_at":"2026-08-10T20:22:30.083794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.068755Z","title":"Attend what you need: Motion-appearance synergistic networks for video question answering,","venue":null,"work_id":"b9bd4074-f6ce-4653-bed2-d87df30f4d66","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.820087Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:fcb4c6bf69587bafd792131f4b5f77f2dd20aead5b1b8feee7c4dc8d4db9995e","observation_id":"78a8b23e-b5f6-4ecc-8f34-c9b7493bd253","resolution":{"observed_at":"2026-08-10T20:22:30.072790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.058488Z","title":"Video as conditional graph hierarchy for multi-granular question answering","venue":null,"work_id":"7306a99f-f0fb-463e-9f00-4b417e03023e","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.824049Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:4aa73ef869baddf711002eb575c56f2dbe15e5be29cd3ca03966a25eebc6f169","observation_id":"58cab2bd-070b-4bfe-807c-6733d6ab7df8","resolution":{"observed_at":"2026-08-10T20:22:30.061788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.048570Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":"561a61c4-af34-4ea3-9c2f-ec8a47482a56","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.828251Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:b3fb87b2c9afb8ec4fedd0ec757092bb96cf5d20fbda53fb8b617f45fd03fa20","observation_id":"852a8b05-c6fc-4fb9-8212-9d3c23425d1b","resolution":{"observed_at":"2026-08-10T20:22:30.052125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-10T20:22:28.832209Z","title":"Violet: End-to-end video-language transformers with masked visual- token modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.832209Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:14678ecf24ecd316f69310aa894adc03ebd5bd5229071c2c9cc0b004bf4d87da","observation_id":"21caaec5-68af-4a53-bed9-af6c1a4b862a","resolution":{"observed_at":"2026-08-10T20:22:28.832209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12402","last_updated":"2023-07-30T13:20:13Z","snapshot_observed_at":"2026-08-08T05:02:29.486711Z","submitted_at":"2022-11-22T16:48:01Z","title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12402","snapshot_observed_at":"2026-08-10T20:22:28.836606Z","title":"X 2-vlm: All-in-one pre-trained model for vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.836606Z"},"links":{"cited_paper":"/paper/2211.12402","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0ca5467884f541a9d21e192a090a20379324f310713bb990281695374a213ac7","observation_id":"803b90c5-5350-4593-ad3e-b099f4f80ad1","resolution":{"observed_at":"2026-08-10T20:22:28.836606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T20:22:28.840944Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.840944Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:ecfa96bf2c8fc07aa8147e81fd5ab22786aec764821f2d32c09b83b5f913c88b","observation_id":"a1bf4bc0-51da-4e06-92df-b148982abc98","resolution":{"observed_at":"2026-08-10T20:22:28.840944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.037603Z","title":"All in one: Exploring unified video-language pre-training,","venue":null,"work_id":"8d11ecd7-4045-4c9e-be4f-1e3bb87ab865","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.845487Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0d44df8d4e4ef2fc34d8ece587c3f7fd50daaa51bd25940a2746ad8b1b086292","observation_id":"9b75616c-ba59-4a81-b431-8e48192bd12a","resolution":{"observed_at":"2026-08-10T20:22:30.041510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.024865Z","title":"Invariant grounding for video question answering,","venue":null,"work_id":"cd5b89d3-ef2e-4e6a-9a23-ea2872149b9b","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.849971Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:41038445df534ec750c9151758a5d5a598c337fca1ef3df25a537cbba2f26d1f","observation_id":"1eb77c64-db60-464f-bb67-2227cdef559f","resolution":{"observed_at":"2026-08-10T20:22:30.029231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.010622Z","title":"Equivariant and invariant grounding for video question answering,","venue":null,"work_id":"55a34a44-d226-4746-bc2c-69d9b1c6b805","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.853927Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:90a5acdd7e018a19287be76ced9c84424b3ded152fc2e8f1e41c965bf3fe21d8","observation_id":"bd64f643-ca09-41ba-a6c7-a19c30af739e","resolution":{"observed_at":"2026-08-10T20:22:30.016176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.996251Z","title":"Transformer-empowered invariant grounding for video question answering,","venue":null,"work_id":"72d276d9-72fa-4ec2-9e1d-467751b93203","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.858221Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:5d66f014bb16643df399da79ecb4af54b7f793d67816a5ed6681f42493fccde9","observation_id":"31bda1b2-d1e2-41f1-8610-04c2a0ef86fb","resolution":{"observed_at":"2026-08-10T20:22:30.000451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.984380Z","title":"Discovering spatio- temporal rationales for video question answering,","venue":null,"work_id":"fadda146-d962-42a0-81c9-792acddcc9fb","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.862463Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:a4af6ed40dd62b059f65f9deb99cb9f9c6e24e2311d77d88be718d8477d6e88f","observation_id":"dcbdd53f-f305-4ab8-926c-31a3dd24f80a","resolution":{"observed_at":"2026-08-10T20:22:29.988421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.972650Z","title":"Adversarial vqa: A new benchmark for evaluating the robustness of vqa models,","venue":null,"work_id":"f45e7b8c-c3bb-4178-a192-fdf3ed1b82df","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.866406Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:784fdaf998f9e919bf039c52d9b854a8060808979fa3df9c77487e7c869051e6","observation_id":"4819a8d9-4faa-4d3d-9909-24a637d781d7","resolution":{"observed_at":"2026-08-10T20:22:29.976532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.960215Z","title":"Discovering the real association: Multimodal causal reasoning in video question answering,","venue":null,"work_id":"57c16781-ab90-4635-b4b1-d6c4f1d96fc7","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.869197Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:6a710872d4a21b76dd2a3b3a305677cc3005781852cb0d0400c41783038ead14","observation_id":"51a192e9-c3b7-48e5-acff-21624f1775ce","resolution":{"observed_at":"2026-08-10T20:22:29.964326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.947054Z","title":"Coun- terfactual vqa: A cause-effect look at language bias,","venue":null,"work_id":"1319abe2-d64d-4832-ace4-f1f6a22b4a40","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.872228Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:a70aaf1f22a08eb863287644f610ef8ea4d1bdf2854a265e5db782d9bca0c212","observation_id":"a49e0de7-7419-402d-a33b-e09219841169","resolution":{"observed_at":"2026-08-10T20:22:29.951666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.934145Z","title":"Beyond question- based biases: Assessing multimodal shortcut learning in visual question answering,","venue":null,"work_id":"96b33bcd-d2d8-4059-8878-925b86b1e1ba","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.875299Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:93886e231dfab06d19eea8484008f5685ed7cf3babb19ff8e2703868994610bb","observation_id":"e8864a2e-5808-40c6-b518-77ab0c08d48f","resolution":{"observed_at":"2026-08-10T20:22:29.938674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.921602Z","title":"Roses are red, violets are blue... but should vqa expect them to?","venue":null,"work_id":"34ece9e7-eed6-4a0c-820b-b2ede76428e0","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.878700Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:914d7815e2afffa753d84b46f4557a2366355412e5bc31d77b0e60ca4482a7da","observation_id":"d575a6f5-4b9f-4d92-b8cc-39f2a7f3baa7","resolution":{"observed_at":"2026-08-10T20:22:29.926218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.907319Z","title":"Human-adversarial visual question answer- ing,","venue":null,"work_id":"c41bd97d-1073-4f46-8fc5-6d4e7b7f3cab","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.882176Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d719bc7b80a96fee73a51400bcd905f333f92fe8c1917cf3c131a56a913af1d4","observation_id":"b2019ef5-2c84-4f92-a84e-c247a7e3a4d3","resolution":{"observed_at":"2026-08-10T20:22:29.912538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.894173Z","title":"A survey on curriculum learning,","venue":null,"work_id":"2c638428-c145-4e7e-b428-5a9d72b05709","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.886366Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:fd9ae13dd355b52fed87be47e9e884bd6af50db5aa1c0a255a3c4ac30a4b34c3","observation_id":"4e026506-d2ad-4521-ae3e-6cad9a0e5ec7","resolution":{"observed_at":"2026-08-10T20:22:29.898588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.889818Z","title":"Curriculum learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.889818Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:45db58c7ce54ffb263678993e0b286951c5f33ce7593fde645d94df80e366b43","observation_id":"3e8ded24-e28a-4311-8830-2aeb40d69a6b","resolution":{"observed_at":"2026-08-10T20:22:28.889818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.874074Z","title":"Tgif-qa: Toward spatio- temporal reasoning in visual question answering,","venue":null,"work_id":"572a61cd-edfa-4f32-a029-34a618273a41","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.893376Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:fe8f0922fe80d2fda749b050c7ca79faa8f89cf5d3b1bea6f826d16d5078d540","observation_id":"d0b6f7db-8ade-4e59-ac02-3bccd89b6f9b","resolution":{"observed_at":"2026-08-10T20:22:29.878483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.864294Z","title":"Revisiting the","venue":null,"work_id":"be1bd2f9-7b91-4d5c-b555-5fc02d7db23f","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.897187Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:06303685d0b38ad1a32857a613bc470d2df2a9ef797d15c8eb98ab6b561e2176","observation_id":"bb3893a4-465a-41e6-85a1-5026b5dd85fa","resolution":{"observed_at":"2026-08-10T20:22:29.867380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.901073Z","title":"Answering from sure to uncertain: Uncertainty-aware curriculum learning for video question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.901073Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:522f2ec62ef7843231765a35b63412caa60a29a29c96d38d6cae7d298c52bf56","observation_id":"b2da382d-c2bd-44d2-9171-27d8ee531a5f","resolution":{"observed_at":"2026-08-10T20:22:28.901073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.854093Z","title":"Question-guided erasing-based spatiotemporal attention learning for video question answering,","venue":null,"work_id":"249534c5-e73f-4cce-bd0c-d8ba145b0aca","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.904741Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e15c452f3b0447df38bb23329b72a921e5ecdef9a57adbb02608c6e0371fd72e","observation_id":"e2a152b2-a62d-42ff-86cd-e1328346f135","resolution":{"observed_at":"2026-08-10T20:22:29.857861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.842626Z","title":"Memory augmented deep recurrent neural network for video question answering,","venue":null,"work_id":"dce143b0-db34-4e36-9a0f-fed756fbad2b","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.909220Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:5b4f3838dd67c2ed8aa5fb71b1d7cc1f4effed3488bd52ee366792cb0d1b7fd6","observation_id":"06093558-5918-49fd-9669-f538d0ec5d5f","resolution":{"observed_at":"2026-08-10T20:22:29.846939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.831515Z","title":"Knowledge-routed visual question reasoning: Challenges for deep representation embedding,","venue":null,"work_id":"ba2687e9-9573-4636-83ae-423c482d0528","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.913520Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0ea3dc53360f1948db293e4740fc5d91dc7007eb565b4c422912a21ead8362ea","observation_id":"431db470-deaf-48f4-a4fe-75b4f3d4abc5","resolution":{"observed_at":"2026-08-10T20:22:29.835410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.819366Z","title":"Multitask learning for visual question answering,","venue":null,"work_id":"d45854a8-6441-4011-9911-de7f046b1033","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.917336Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:eacc5f34a37b51bc0a437de812197790d1ee46057c987a94ef21f25c05c0caaa","observation_id":"b3be0ff1-18e9-4203-8bcf-5a412b7c57d0","resolution":{"observed_at":"2026-08-10T20:22:29.823215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.808027Z","title":"Bilinear graph networks for visual ques- tion answering,","venue":null,"work_id":"f641a0a2-6b73-4360-9cca-85d820d39d20","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.922428Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:bc6feba06f843d357aed445113e3a4a87a01a6b78e43630562f0c02261e3af2f","observation_id":"b830ec11-203f-4216-b2f6-8cabae86c334","resolution":{"observed_at":"2026-08-10T20:22:29.811946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.796170Z","title":"Bilateral cross-modality graph matching attention for feature fusion in visual question answering,","venue":null,"work_id":"39df76ef-abc0-49a6-95ee-681d9d08c80d","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.925840Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e4ca653e9ec4f5c89c2e768f3963a057cb631b46f931d6110b27c527d56d864c","observation_id":"a36e2dd3-5034-466a-8c1f-e7fd57e0df58","resolution":{"observed_at":"2026-08-10T20:22:29.800548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.783411Z","title":"Bridging the cross- modality semantic gap in visual question answering,","venue":null,"work_id":"3add33f7-5257-4185-bbeb-cd25e3a2117b","year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.929126Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3fe2d3c1a1ccb6beedabed252c36d1208db87d14e018595257212e3cdb05538d","observation_id":"45178bf5-0eb8-414d-9906-9416d950a396","resolution":{"observed_at":"2026-08-10T20:22:29.787587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.772236Z","title":"Latent attention network with position perception for visual question answering,","venue":null,"work_id":"c871a682-0ae9-418a-83be-324002711e80","year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.933066Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:6294fae947f0c4dd58cbc87f9654bfcffd047e598d50faace9f8e1497753722c","observation_id":"cc25a2d1-e088-44e7-9b65-4fd7ae5029a7","resolution":{"observed_at":"2026-08-10T20:22:29.776048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.760976Z","title":"Webly supervised knowledge-embedded model for visual reasoning,","venue":null,"work_id":"934f4bda-bb9d-4df5-92a6-900fa6b39f36","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.936324Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:2147a6796aee16c9489a5b9b881a4521b214ac025b9a55403ee09bc9dce324aa","observation_id":"aac3d65f-0e70-4238-9cc7-daabc6288571","resolution":{"observed_at":"2026-08-10T20:22:29.764674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.748675Z","title":"Uncovering the temporal context for video question answering,","venue":null,"work_id":"8af4f475-7c7e-4fe8-a357-9a2079d656a1","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.939590Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:38be8fcb9fb37c2a819c17ca63a68d6710929de78b67461d90561361e6f97b5c","observation_id":"c7110ae4-0f09-434c-9d73-442c8d76815b","resolution":{"observed_at":"2026-08-10T20:22:29.753036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.736219Z","title":"Video question answering via gradually refined attention over appearance and motion,","venue":null,"work_id":"a4572aa1-cd9c-4373-a286-35b871cd0c95","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.943213Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:33fbaf5b0c02bb5cc0910cb74f5e333dc79ccbdf56bb9586493ecc6b077435e9","observation_id":"8d3ecdae-de28-48e3-8d52-27ad057b8c44","resolution":{"observed_at":"2026-08-10T20:22:29.740341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.723961Z","title":"Divide and conquer: Question-guided spatio-temporal contextual attention for video question answering,","venue":null,"work_id":"fbb510fa-4d1d-4201-865a-75762e23661f","year":2020},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.946761Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:29bbb7a5608d8948325342818cc486c1a952e18b63fd8f5b68a7e40983a30ae0","observation_id":"863e8001-2d72-42b1-ad53-1526236563e3","resolution":{"observed_at":"2026-08-10T20:22:29.728219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.711979Z","title":"Video question answering with spatio-temporal reasoning,","venue":null,"work_id":"c739e7a3-8cda-455c-87a4-0f5010c773a1","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.950509Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:fe59ffb4ab4fab9bc2d469ae3822db612af6a8b4afda1a530e3c97a23cdab2af","observation_id":"8dc85746-341a-442d-9ad1-b34a4b8fd5e1","resolution":{"observed_at":"2026-08-10T20:22:29.716195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.699837Z","title":"Dualvgr: A dual-visual graph reasoning unit for video question answering,","venue":null,"work_id":"a84a4b08-8a8e-4d09-8702-a78f2a6c1145","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.953955Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0d2b4e271b41dd073f0c424924156848390bb3f4d8cbff261b6b62a13de15c8a","observation_id":"69e3270d-7c37-4141-9d1a-424baa1332d6","resolution":{"observed_at":"2026-08-10T20:22:29.704012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.687253Z","title":"Bridge to answer: Structure-aware graph interaction network for video question answering,","venue":null,"work_id":"bde9cc6d-47c0-459a-81d5-59c4c26dbcbe","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.957975Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e8fb80eb170beb686fd3bbdbad3692d4c545142b0a02ce5425d8d737b93ed6b9","observation_id":"3cd45be9-6a74-4205-af87-22150a4fa54e","resolution":{"observed_at":"2026-08-10T20:22:29.691371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.675443Z","title":"Motion-appearance co-memory networks for video question answering,","venue":null,"work_id":"6364fe55-313c-4887-bcbc-e047a6972b9b","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.961511Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:1839393102f00eb9288fcca946319173d480b23a593d89387feb27fc52b9583d","observation_id":"bd0de087-f9af-47aa-a621-98dddf70774b","resolution":{"observed_at":"2026-08-10T20:22:29.679267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.664287Z","title":"Heterogeneous memory enhanced multimodal attention model for video question answering,","venue":null,"work_id":"fa9792b7-573a-463f-b405-12fd43b49849","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.964910Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:63a5472541d0a82e5684e8c07f012ced8948dff01c4f0bb0adc4a54d2dd052ea","observation_id":"c1149717-3af7-4511-80d4-ea9312ec6448","resolution":{"observed_at":"2026-08-10T20:22:29.668248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.652646Z","title":"Hierarchical conditional relation networks for video question answering,","venue":null,"work_id":"4485da00-019c-4878-8bf1-24aa64299dfd","year":2020},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.968357Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:1794812d2188d8b89041ece9263d39cb53e0cc00b297bfc79b98ea370e66450a","observation_id":"0fc7a196-c301-474e-a175-c42904a5edbf","resolution":{"observed_at":"2026-08-10T20:22:29.656871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.641625Z","title":"Verbs in action: Improving verb understanding in video-language models,","venue":null,"work_id":"d93acb20-5942-4646-9614-de937ee4b88d","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.971679Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0e9d116ff9ff4a3c29b6c1e5e162eaf29bdcf4e6c026b7f0d5b7407d42f1b8d1","observation_id":"e3cfb448-3188-4f39-a469-c80dc57ae182","resolution":{"observed_at":"2026-08-10T20:22:29.645191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.629585Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","venue":null,"work_id":"aad42667-600d-40b6-a4f8-ae5af8c9e06d","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.974963Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7b716d57b97f55fc792307274f24c8e4d5b5277f5bf520e8c1fb8d3d97d17ced","observation_id":"42900346-0920-434b-ad7a-25087c9f9ff9","resolution":{"observed_at":"2026-08-10T20:22:29.633656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.978593Z","title":"Teaching structured vision & language concepts to vision & language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.978593Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:a2d4da68e8345d2e996835fea194f6a8328bce622ae6ce2898d0b317f2b49a94","observation_id":"aebf50f1-0815-48f5-981b-127bb796945f","resolution":{"observed_at":"2026-08-10T20:22:28.978593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.609750Z","title":"Rubi: Reducing unimodal biases for visual question answering,","venue":null,"work_id":"70608137-0c53-4cc4-9a9b-7b1e4b17445f","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.981805Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7ec1cb7c447b2785db8d328b7d5f18b7d6578d764c99372bd66003c817c8d9d8","observation_id":"3a7f542e-94e2-4463-b39b-ce6ffd6f613d","resolution":{"observed_at":"2026-08-10T20:22:29.614069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.596280Z","title":"Don’t just assume; look and answer: Overcoming priors for visual question answering,","venue":null,"work_id":"82e1283a-e2b1-44fa-adfe-b521e7a9c4a8","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.985272Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:8ddac42fb9e9873c8b54dcdd1adefd0d7e5c4e5a366e0434d84e937fc4884d52","observation_id":"0390a37c-da9f-41b4-b8a0-51f726c37a2b","resolution":{"observed_at":"2026-08-10T20:22:29.600848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.584597Z","title":"Overcoming language priors in visual question answering with adversarial regularization,","venue":null,"work_id":"35e704a2-e415-4d47-879d-5f5df1bcd44c","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.988924Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:14dcd3bfce811b928d4ab0b455e90ac35ce39006e7984648058a94273a86ae65","observation_id":"0ea48d93-d1da-411f-9aa2-eb29c500de50","resolution":{"observed_at":"2026-08-10T20:22:29.588740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.573110Z","title":"Reliable visual question answering: Abstain rather than answer incorrectly,","venue":null,"work_id":"31227152-18fc-4c49-80e6-a19f01ae0eab","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.992385Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:41fd4a866903b6c55639c25780315b7c1022016b17fd8436d7081dde16196604","observation_id":"2297cfd9-6abf-4134-9808-5ac885c7dc23","resolution":{"observed_at":"2026-08-10T20:22:29.577485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.996874Z","title":"Addressing failure prediction by learning model confidence,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.996874Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:af2c922b0f0ae5ad0fcbc67f7d8fb899b862932e84edf72844f35bab29d67347","observation_id":"889e1f67-fff4-4e59-aada-db3fe4670164","resolution":{"observed_at":"2026-08-10T20:22:28.996874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10964","last_updated":"2019-08-01T22:05:44Z","snapshot_observed_at":"2026-07-31T04:07:39.251020Z","submitted_at":"2019-05-27T04:00:51Z","title":"Combating Label Noise in Deep Learning Using Abstention","version":2},"cited_work":{"arxiv_id":"1905.10964","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.10964","snapshot_observed_at":"2026-08-10T20:22:29.176221Z","title":"Combating Label Noise in Deep Learning Using Abstention","venue":"stat.ML","work_id":"3c86718e-dca7-4bb6-8b08-47ed75bfcbf7","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.001019Z"},"links":{"cited_paper":"/paper/1905.10964","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:400583e815be4b75e8a4f0e7530f7993d31d1f8667930f0aee86d4f8d621b2c9","observation_id":"4b57a7cf-c70b-4472-909e-31cc9f10b7f6","resolution":{"observed_at":"2026-08-10T20:22:29.182883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.555812Z","title":"The art of abstention: Selective prediction and error regularization for natural language processing,","venue":null,"work_id":"0d8c6349-c696-4f45-8f57-9da7f2586966","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.004953Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:1bd08c2709a43bcae3258cb5e866b466d4b4b8dbb44b1ccfae7344fc88b6e88b","observation_id":"ddf71bdb-f7d6-42df-ae1f-a2794b0077d5","resolution":{"observed_at":"2026-08-10T20:22:29.559720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.543745Z","title":"On the foundations of noise-free selective classifi- cation","venue":null,"work_id":"c9cadeee-eb55-4811-bd10-89d89bb7fbe1","year":2010},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.008397Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:37b06b73d31ffce8c040d68369fe7a738e075544b967da00c4bf7fb8463352d5","observation_id":"7a613141-c7e7-461b-b55f-889d64a619b3","resolution":{"observed_at":"2026-08-10T20:22:29.547982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00211","last_updated":"2022-03-01T03:35:37Z","snapshot_observed_at":"2026-07-06T12:42:41.294363Z","submitted_at":"2022-03-01T03:35:37Z","title":"Investigating Selective Prediction Approaches Across Several Tasks in IID, OOD, and Adversarial Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00211","snapshot_observed_at":"2026-08-10T20:22:29.011509Z","title":"Investigating selective prediction approaches across several tasks in iid, ood, and adversarial settings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.011509Z"},"links":{"cited_paper":"/paper/2203.00211","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:6ecfdf98edd3b4baace07dcf26041173ae4f78dcc0ec6629f2e4a46ac6f1b2a3","observation_id":"1379861a-8ac1-4286-ba1b-c9a08c13a3e8","resolution":{"observed_at":"2026-08-10T20:22:29.011509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.531346Z","title":"Selectivenet: A deep neural network with an integrated reject option,","venue":null,"work_id":"fb295660-db2f-4ffc-b0d2-a299fbf87c8d","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.015510Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:a099f87ef7ac2402c76732f727688704b99743964631d9f9a4a5a7f24954ebdc","observation_id":"3341b454-363a-46cb-ab49-62b3041d7861","resolution":{"observed_at":"2026-08-10T20:22:29.535581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.519728Z","title":"Selective question answering under domain shift,","venue":null,"work_id":"c8e7e465-5b23-4d2c-a28f-8a02dca5108f","year":2020},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.018882Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:c6eb6333c04eb3f76cf339c148204a32846fc45144a3dd9bf52cbc8917625937","observation_id":"e151b0e8-61a6-4d4a-87b5-20442f4a437d","resolution":{"observed_at":"2026-08-10T20:22:29.523427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.022646Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.022646Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:06f37ce47bf311bb8dc51afa3dbb7a26910e06b42744f7fee33274b42e9f80da","observation_id":"1325e5ac-d15d-4ada-9316-a8365ef8b309","resolution":{"observed_at":"2026-08-10T20:22:29.022646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.026236Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.026236Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:19b38e1c9708144bfeb63566864814312c6824defd7fa95e4ddae731b196d79a","observation_id":"0f449ef2-86c9-4a81-9fda-b7d70ecf11fb","resolution":{"observed_at":"2026-08-10T20:22:29.026236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.492301Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"486cef4f-2f1d-42ca-8623-9aa6a16bc2d7","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.029742Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:4fed32dedb26c6a98804c9e1de4023d864ef4e71570991395a91447112ec7485","observation_id":"2f469043-f51d-4d8e-8e30-0a21a2fb13e7","resolution":{"observed_at":"2026-08-10T20:22:29.496535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.480688Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips,","venue":null,"work_id":"d0de6002-5d96-4e50-bc9a-a3bfa896ae8a","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.033198Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:14afc6a288109ed841a5ee6d13ca0fd9004ba981e55153c6589ae45fd75bb2b9","observation_id":"99d0fe4a-e38b-4ac0-8e79-f35b8e9f8117","resolution":{"observed_at":"2026-08-10T20:22:29.484728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.469212Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions,","venue":null,"work_id":"d4103055-2711-4043-b409-f57979918ff6","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.036935Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f356a9a5ace9cad43db8b9ea9e3254a338604f3871cc529edd11d8087a755543","observation_id":"094aa94b-d13c-4553-bd4a-22f3d69d4f8f","resolution":{"observed_at":"2026-08-10T20:22:29.473291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.457587Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"30296b43-b3ff-4bec-aeeb-96e30033955a","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.040850Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:34177d6b751fb5111facda8c67527ea74466cd51bc9caeebf9ff6bf3c4408c2e","observation_id":"999faf4b-2dce-45c4-9888-1b0b1c780e61","resolution":{"observed_at":"2026-08-10T20:22:29.461656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.446011Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"6a581a1d-3fc3-46ee-9ab5-3f57068c2c9a","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.044658Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3f9edc7993efb98a7e6927855d0331cc3bce9ca5b3cad61de3de7457b704d4fb","observation_id":"edf1e6c2-5324-4e8d-a7e5-b820685d25e4","resolution":{"observed_at":"2026-08-10T20:22:29.450128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13432","last_updated":"2021-08-25T11:36:26Z","snapshot_observed_at":"2026-08-10T03:15:11.377266Z","submitted_at":"2021-06-25T05:12:42Z","title":"Hierarchical Object-oriented Spatio-Temporal Reasoning for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13432","snapshot_observed_at":"2026-08-10T20:22:29.048239Z","title":"Hierarchical object-oriented spatio-temporal reasoning for video question answering,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.048239Z"},"links":{"cited_paper":"/paper/2106.13432","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e9f27d297166efa9439f9d549576cc811398f1e7b4cecd95b345b9f1f576b54e","observation_id":"21650f3e-d479-4a7f-9edc-e1f891b68af4","resolution":{"observed_at":"2026-08-10T20:22:29.048239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.434175Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":"ea9219fa-3207-46b3-86ed-13cd5178b47a","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.052228Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d521201d9772a5039ff64e8e3dc6aacf165d5f8ee5d8719757cc1ea185f1517e","observation_id":"ad5ab970-1c3d-4c30-b94a-cfb9e4e2cd4f","resolution":{"observed_at":"2026-08-10T20:22:29.438477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.055862Z","title":"Causal inference in natural language processing: Estimation, prediction, interpretation and beyond,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.055862Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:35a7981455cba33fc5104e70348ec1a5aedc32a3e1df2d96805115bbd291a89e","observation_id":"adbb3e57-2533-42ff-9de2-c5893e946466","resolution":{"observed_at":"2026-08-10T20:22:29.055862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.415795Z","title":"Docogen: Domain counterfactual generation for low resource domain adaptation,","venue":null,"work_id":"37ad3afe-327c-47cb-aba1-72382172cfc6","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.059587Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e81d350b5d8ea04096472bdf4aad53433a7a20603593d5beb315d3b5f562f788","observation_id":"758ebd2b-997d-491a-9a43-aa119f008327","resolution":{"observed_at":"2026-08-10T20:22:29.419757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00288","last_updated":"2021-06-01T17:13:45Z","snapshot_observed_at":"2026-08-10T00:58:32.021180Z","submitted_at":"2021-01-01T18:34:22Z","title":"Polyjuice: Generating Counterfactuals for Explaining, Evaluating, and Improving Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00288","snapshot_observed_at":"2026-08-10T20:22:29.063214Z","title":"Polyjuice: Au- tomated, general-purpose counterfactual generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.063214Z"},"links":{"cited_paper":"/paper/2101.00288","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:584da84b9af92772b0af5bcbf661ac3887d63a02c67be262c72be5165e472a14","observation_id":"4967e378-4854-41ca-bcab-a0c2b723200c","resolution":{"observed_at":"2026-08-10T20:22:29.063214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.067137Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.067137Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:bd8599c2374df5acf004ad8472b2e809b1cd8fc25c870180206cfafcb5e1d0d9","observation_id":"3c9abe9d-38ec-438e-a2fc-2ae6b0974985","resolution":{"observed_at":"2026-08-10T20:22:29.067137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-10T20:22:29.070599Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.070599Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:473dc2b5c1fa8b60d030f3ad177b0edd5ac979779603cfdf32a7720736938fdd","observation_id":"e7017573-60f0-4102-aeb3-ff0fc7b0940b","resolution":{"observed_at":"2026-08-10T20:22:29.070599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.074601Z","title":"Stacked attention networks for image question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.074601Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7964985a7c6f12c362b88ed17f5a5457f924a1455c290b90c4ead1cdebc88e15","observation_id":"3c5a5043-d24b-441b-9a3e-7133004cc6ac","resolution":{"observed_at":"2026-08-10T20:22:29.074601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.389302Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding,","venue":null,"work_id":"c8cf697c-638e-4550-a53b-b52a0c4caf5b","year":2016},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.078064Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0e5211b23c066af18b74dcc21fd256c975fbc789a55ec7a84c81b13cbe163a96","observation_id":"f693dfea-2e83-4e8b-9452-b39d8a32a65d","resolution":{"observed_at":"2026-08-10T20:22:29.392912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.081042Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.081042Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:b8a744514777bfe15c80b5f5848bc90802ab63220913d00e16581c3432657e0b","observation_id":"d2d1af64-df40-4420-9a50-aa37acd053a1","resolution":{"observed_at":"2026-08-10T20:22:29.081042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.083891Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.083891Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d7ac126f79a80f82b23909018c74a41d093d0e636801b86b33b2e170ecc7a839","observation_id":"eceb8198-17c8-4dd0-993a-e8d068f6e578","resolution":{"observed_at":"2026-08-10T20:22:29.083891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.364114Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"d871319b-fa2e-4bba-bbca-e42ae93bc875","year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.087051Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:155ebb4c77760fdddbd7b4965fb46c0bbc26f160f38a5fff747beb290eecb717","observation_id":"2abc7e2f-be50-408b-a452-3a954810dc27","resolution":{"observed_at":"2026-08-10T20:22:29.368636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T20:22:29.090022Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.090022Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:ea7fbf052a13d6572f6c53b913633f9c500c6efa9da59b46d63f84e6e21a5751","observation_id":"2938132f-fb81-4bf3-b4bd-7aa0e143015e","resolution":{"observed_at":"2026-08-10T20:22:29.090022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T09:05:13.248930Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":55},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2501.08771."}