{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a54cf8172a9b19eecbc55b719e78bd96080b57b85d1e7b6d51ebb79c28536b8d","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:41:39.062407Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04976/citation-record","integrity":"/paper/2507.04976/integrity","json":"/paper/2507.04976/citation-record.json","paper":"/paper/2507.04976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.387203Z","title":"Figure 14:Prompt used for Evaluation:(a) Evaluation prompt for answerable dataset, and (b) Evaluation prompt for our unanswerable dataset","venue":null,"work_id":"9e3783ea-b07b-485b-9649-7fd49f09f969","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.870093Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:e2a48d4ea1013ffe1ed4a5a2db30e79e9b36a1c317748c00f17c38015048dbfa","observation_id":"8dc3bbba-9988-4504-9af2-da643588d748","resolution":{"observed_at":"2026-08-06T19:41:40.468104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:41.285613Z","title":null,"venue":null,"work_id":"4bd26a1a-ea9d-4071-9802-3e762225791e","year":1901},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.065756Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:3fc29b2148035590203b3baafa7a65d9ddebe90a296696ae65da06c4664e4072","observation_id":"02f5da86-7927-41f2-a283-6efff1c09946","resolution":{"observed_at":"2026-08-06T19:41:41.346617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.644726Z","title":"A.3 ETHICSSTATEMENT In our study, we utilize Large Language Models (LLM) to generate our UVQA dataset and evaluate video-LLMs, which may result in unintended outcomes","venue":null,"work_id":"817eb98c-fbb6-4e4a-8ff3-d89fc26d8d4b","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.744180Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:686b2d1da74664b1e4c67fd0e3b451490dc84924432c1abe27e3c8dbf132b472","observation_id":"57943758-8e5e-41ea-94d9-3e882fba7ed4","resolution":{"observed_at":"2026-08-06T19:41:40.705794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:41:37.255667Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.255667Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:0c9c1d9d25e4375f63b8f2cb6e74931c437e7e37b10e4cbc8b8ee104dbb5a674","observation_id":"85137c54-8704-444c-bb7d-3a88e310606d","resolution":{"observed_at":"2026-08-06T19:41:37.255667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10942","last_updated":"2024-08-21T06:13:53Z","snapshot_observed_at":"2026-07-31T03:23:07.789560Z","submitted_at":"2023-10-17T02:38:09Z","title":"UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10942","snapshot_observed_at":"2026-08-06T19:41:37.335716Z","title":"Unanswerable visual question answering.arXiv preprint arXiv:2310.10942,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.335716Z"},"links":{"cited_paper":"/paper/2310.10942","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:15475ae5000d2c5c41fd14bfbde5abcc67451bd86ce91e545f2ffa0c4387420c","observation_id":"73f65394-be23-4b3f-a8e5-b7a101e5b96d","resolution":{"observed_at":"2026-08-06T19:41:37.335716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:41.161358Z","title":"URL https://aclanthology","venue":null,"work_id":"cb33b099-7afd-41d9-8255-902945659ef2","year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.912431Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:3cd03dc155aaec73be9f5b462cc410269bc32d463edf66d007accd2403d9a245","observation_id":"62189781-c344-4e24-b858-45b5902f6ba8","resolution":{"observed_at":"2026-08-06T19:41:41.204900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02655","last_updated":"2022-05-30T19:45:05Z","snapshot_observed_at":"2026-08-06T04:48:55.317633Z","submitted_at":"2022-05-05T13:56:18Z","title":"Language Models Can See: Plugging Visual Controls in Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02655","snapshot_observed_at":"2026-08-06T19:41:38.021957Z","title":"Language models can see: Plugging visual controls in text generation.arXiv preprint arXiv:2205.02655,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.021957Z"},"links":{"cited_paper":"/paper/2205.02655","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:9f751ee2bb239ba9976e98a934e62080abcadcddc040bd680cd41da53414e5e0","observation_id":"00f23829-0ca4-4a92-8137-c43ac7228a64","resolution":{"observed_at":"2026-08-06T19:41:38.021957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T19:41:38.043123Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.043123Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:96cdd1b0b35921b549f2795909d05c73013169457a32f9b0dd6fba24a76d6a88","observation_id":"9118d1cc-2d16-46f2-b112-37ed7af3a42a","resolution":{"observed_at":"2026-08-06T19:41:38.043123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:41:38.101205Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.101205Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:0f8dc9f2d0e0363e2ef05287014738befb88671fde29f93bf08433f94a28ec16","observation_id":"0347a6c8-223a-4acd-985c-78e758eeced3","resolution":{"observed_at":"2026-08-06T19:41:38.101205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18418","last_updated":"2025-02-12T05:42:09Z","snapshot_observed_at":"2026-07-06T18:52:07.765911Z","submitted_at":"2024-07-25T22:31:50Z","title":"Know Your Limits: A Survey of Abstention in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18418","snapshot_observed_at":"2026-08-06T19:41:38.196093Z","title":"Know your limits: A survey of abstention in large language models.arXiv preprint arXiv:2407.18418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.196093Z"},"links":{"cited_paper":"/paper/2407.18418","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:ba59508410aade379be2ae64c06da8b04b3e91835fa78a67e20511cb08f690c4","observation_id":"0683f6b1-37ae-4a44-a710-5083f293a2a1","resolution":{"observed_at":"2026-08-06T19:41:38.196093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:41.026681Z","title":"Reliable visual question answering: Abstain rather than answer incorrectly","venue":null,"work_id":"54adc77a-a822-4be7-a424-3b22602ab882","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.247478Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:e9f476d8477dfc347d26db8fc42f13f3620ee2ae0b0b60b368fac1b240a526de","observation_id":"8881582b-3d4b-45c7-9a09-7e66de6adf72","resolution":{"observed_at":"2026-08-06T19:41:41.101947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:38.377164Z","title":"TLCR: Token-level continuous reward for fine-grained reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.377164Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:5b0e877f7066bbfcf54ebf5c28dd22eb923c0570ad07a4d9944d2fb0f07992af","observation_id":"94a70e9d-42ba-4c91-8346-677d493d6595","resolution":{"observed_at":"2026-08-06T19:41:38.377164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.280","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.131429Z","title":"doi: 10.18653/v1/2022.emnlp-main.280","venue":null,"work_id":"d2da3256-1866-431b-8c1c-1db442e1fc54","year":2022},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.442554Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:64eadbea063d9c56233cd4dcb59c711792cf5499457a8cc3864f00f0ca1bb7ca","observation_id":"161abb5c-963a-480d-9f2d-f8cc0305dab7","resolution":{"observed_at":"2026-08-06T19:41:39.212989Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:38.481770Z","title":"doi: 10.18653/v1/2023.findings-emnlp.797","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.481770Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:30acd115a8d4c4a119463f4c3c706391f2c67aa836e954f1f97e24ee8909c841","observation_id":"6eb2d644-0901-4600-9cfb-d1dd8dfff21a","resolution":{"observed_at":"2026-08-06T19:41:38.481770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T19:41:38.650060Z","title":"doi: 10.18653/ v1/2023.emnlp-demo.49","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.650060Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:ec56ae0514f36d6054efa1aca6cacd451b02fcff888cf255be2a7c3da73b2543","observation_id":"80aecfca-840e-43ab-83a4-dc31abeba65e","resolution":{"observed_at":"2026-08-06T19:41:38.650060Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.776578Z","title":null,"venue":null,"work_id":"a97ddffc-4fed-4bb9-b0e3-36a81c79b806","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.693004Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:837857b5cfe0b9a2af1b9c58346b8466838b92c9c66c26f849313eafda56c914","observation_id":"f6e78513-1439-4059-a12c-58f917db02c8","resolution":{"observed_at":"2026-08-06T19:41:40.862940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.515483Z","title":"(2023); Li et al","venue":null,"work_id":"e9ee751e-e011-4971-a247-7fda6722aa60","year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.838760Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:50bb0846cefb872ac8b66fd5da6785423e151d7a71d186f77c50c30d79c1403e","observation_id":"c83c0aad-ef3c-41b9-846e-4d605e0a9699","resolution":{"observed_at":"2026-08-06T19:41:40.579369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.214347Z","title":null,"venue":null,"work_id":"04461eed-fbb1-4d5f-ba80-9ec3f1f651bb","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.914823Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:f189a1816296b2d5c33c3d5dc5792e2fade0d4ed98cb2f50e50176fab0899946","observation_id":"062e422e-1d8d-48b5-9331-3c8c8a40b6d8","resolution":{"observed_at":"2026-08-06T19:41:40.309993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.991664Z","title":"If the question cannot be answered using the video content, state that it is unanswerable and provide a reason","venue":null,"work_id":"6bf7d1a5-2f09-43b8-90e4-22bc29b1672c","year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:39.013143Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:c0182311435408dd9bb08d22a8512cd61dc7c91ccfc5ccd365f471ed9be89a1b","observation_id":"2b3a4891-e017-4a31-ac0b-74358f2b3dec","resolution":{"observed_at":"2026-08-06T19:41:40.088734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.863815Z","title":"5All annotators have TOEFL iBT scores above 100 and hold at least a bachelor’s degree","venue":null,"work_id":"86ec6bb6-1a22-4a6f-bee9-868caec33d08","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:39.062407Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:50c3f5adf6ba50d3300531da3cf3deb09aabc147b895cd20f676e3f3875966a6","observation_id":"d5262a23-4d2f-48bc-a386-d802029116e7","resolution":{"observed_at":"2026-08-06T19:41:39.948586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2008.91917","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.544307Z","title":"Justin Johnson, Ranjay Krishna, Michael Stark, Li-Jia Li, David A","venue":null,"work_id":"4e2d825c-306b-42db-818f-db9571835faf","year":2008},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.587634Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:6020ac092e590c95251208c13ffd756ddf3cfa4bf36310bce96ada0c05326da4","observation_id":"df799896-7081-41b3-a7e3-1a1f51c2dac9","resolution":{"observed_at":"2026-08-06T19:41:39.608405Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:37.666437Z","title":"Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, and Lidong Bing","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.666437Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:249e2307e16386e251320e800638ba2653e0c9587d4f36080024944301a11103","observation_id":"6d3a0d12-eb22-46e0-990d-cc9176b83382","resolution":{"observed_at":"2026-08-06T19:41:37.666437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07000","last_updated":"2024-10-28T05:15:30Z","snapshot_observed_at":"2026-08-04T20:05:49.279957Z","submitted_at":"2023-12-12T06:10:42Z","title":"Alignment for Honesty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07000","snapshot_observed_at":"2026-08-06T19:41:38.287739Z","title":"Alignment for honesty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.287739Z"},"links":{"cited_paper":"/paper/2312.07000","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:84b4b7a16d0acaefb78be070f40c7404767e28dc5c87fab72247d963753becc7","observation_id":"75009a38-1cf7-40b2-9eeb-61476426c4a0","resolution":{"observed_at":"2026-08-06T19:41:38.287739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05451","last_updated":"2018-11-01T21:48:19Z","snapshot_observed_at":"2026-07-06T06:23:35.306815Z","submitted_at":"2018-02-15T09:50:15Z","title":"Mapping Images to Scene Graphs with Permutation-Invariant Structured Prediction","version":4},"cited_work":{"arxiv_id":"1802.05451","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.05451","snapshot_observed_at":"2026-08-06T19:41:39.704960Z","title":"Mapping Images to Scene Graphs with Permutation-Invariant Structured Prediction","venue":"stat.ML","work_id":"0d9131da-c0c6-4678-813a-05fe77dfcf20","year":2018},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.410814Z"},"links":{"cited_paper":"/paper/1802.05451","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:f25583a095280b8eb86e8efbb9a64c8ee6e2802f06590004834d228918dedff5","observation_id":"29e42f01-c0a9-4a27-b57b-40a538265d7d","resolution":{"observed_at":"2026-08-06T19:41:39.743993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.889554Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"8bc4385a-24e3-4dac-911a-7aca80473d66","year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.533379Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:acbcac282b8d31526252204fbf2323a56b615eae05eb1f152673fc46b3b9f4cb","observation_id":"e4ea3966-e96b-4e0e-93ab-c2b5f76afa5a","resolution":{"observed_at":"2026-08-06T19:41:40.964592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T19:41:37.146585Z","title":"Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.146585Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:516444a140a4bcbfdcbb53faa171c2fc0741a1cdd144e4b12843105e6fce02a3","observation_id":"6d9a7dca-3d00-45b4-b331-d8a61213e178","resolution":{"observed_at":"2026-08-06T19:41:37.146585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T19:41:37.813687Z","title":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.813687Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:c0dd0a7e0fb492d03cd8274c004de7f074be36967c5e78307515b55b5641b077","observation_id":"0087c442-8ec5-4d59-879e-a0b2f32f4ba8","resolution":{"observed_at":"2026-08-06T19:41:37.813687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:37.497820Z","title":"doi: 10.18653/v1/2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.497820Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:20de21d9dfab70cf7469389ae61f21349d8b9cf47362256c02151dc1a954ccae","observation_id":"08062c73-ad7b-42cc-8184-5b9fbc832a40","resolution":{"observed_at":"2026-08-06T19:41:37.497820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-06T19:41:37.015458Z","title":"URL https: //aclanthology.org/2024.acl-long.52","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.015458Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:f80f4633f55c6919454df9fb2cdcb2222c12829e75556b415174d15af808ab07","observation_id":"9242563d-580b-4c2c-9616-b4cf89155b5e","resolution":{"observed_at":"2026-08-06T19:41:37.015458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:32:26.652181Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.04976."}