{"as_of":"2026-08-20T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c27122bd31c7bd08b529e819636ed262cb3d8c1207dbe09c8f5e6cd7bfc52b2","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:53:01.295207Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14432/citation-record","integrity":"/paper/2504.14432/integrity","json":"/paper/2504.14432/citation-record.json","paper":"/paper/2504.14432"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:53:01.097617Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.097617Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:4a4cd2e22dc20a4801a81d579c51421cbda6d376639184d9197365404946f77c","observation_id":"f304bddb-a710-4735-a1f8-5705df4b77c9","resolution":{"observed_at":"2026-08-16T11:53:01.097617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:53:01.102120Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.102120Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:f9a66dff0f3be0a45063128ccd1a214c5a044afa7adabf4c59e960b225f6f048","observation_id":"6caaec32-146f-4585-9263-2beb1770d82c","resolution":{"observed_at":"2026-08-16T11:53:01.102120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.975966Z","title":"Stanford alpaca: An instruction-following llama model,","venue":null,"work_id":"4c308812-c033-4974-a583-71626bd06fae","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.106292Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:e84dfe128b8c91faeb134e82996e5341d0e22623d366c7aba8df3c7ad29d80d9","observation_id":"2a3d2a0a-338b-415c-8e6a-80765a7e319b","resolution":{"observed_at":"2026-08-16T11:53:01.980865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.962455Z","title":"Gpt-4 technical report,","venue":null,"work_id":"454abc2e-b999-41ab-a763-5a645bde522d","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.110305Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:67554638b5af357fe62f487e407ff996c8a9057b624b894d601963eeec81fec2","observation_id":"278e9e95-9dee-48e8-b39d-177465329327","resolution":{"observed_at":"2026-08-16T11:53:01.966491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.948554Z","title":"Chatgpt,","venue":null,"work_id":"35701e56-f6ea-427b-a015-fb5085e01f36","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.114679Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:6c841ab88509eaf8f3059abdaf1c280da8b2ad0b6b5a13da57ff3e0e9bfbd807","observation_id":"11e441ed-de59-4337-ad8a-b1d44cea5798","resolution":{"observed_at":"2026-08-16T11:53:01.952923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.933850Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"3e271560-b621-409f-b671-7bac965d4f81","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.118813Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:3636509bbe1b7af770548f6c4a25aeb46e94ff9251c8161ff8ead663e7098d80","observation_id":"ea945b28-4b8d-4a52-83bb-052b7efb4391","resolution":{"observed_at":"2026-08-16T11:53:01.938007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.918126Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":"7ea334ad-c10c-4348-b34a-61a2dcb9adcf","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.123276Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:7f475985b864597409e4bf7da90eb546450f1f693c32ee5d32587c4b27c6ce90","observation_id":"5138eca9-1058-4b8b-b10e-dc469b71be32","resolution":{"observed_at":"2026-08-16T11:53:01.923310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-16T11:53:01.127204Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.127204Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:0fc8e19a33b92fafd25aa227425cbe6a5a5832f06ecad03738d5c7057344070d","observation_id":"58c22334-2aa7-4cf8-8cce-55eaece7e4bc","resolution":{"observed_at":"2026-08-16T11:53:01.127204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T11:53:01.131649Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.131649Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:91537916591b65fa6e466e12600bad7513c5d4c22586092b9631b23dd6be99e7","observation_id":"28b26283-eaf9-46c8-935a-18b9b181ab48","resolution":{"observed_at":"2026-08-16T11:53:01.131649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T11:53:01.135610Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.135610Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:dad93c18586c05a227aaa86d2e0e6a7a4e226441b524b78ea329b56cbc30dba3","observation_id":"8851c7de-d104-4564-a291-f29e56dfc6d4","resolution":{"observed_at":"2026-08-16T11:53:01.135610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.902295Z","title":"Locality and compositionality in zero-shot learning,","venue":null,"work_id":"f11abe4c-1032-444e-8f85-89752e393468","year":2020},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.139693Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:13cdd5305e047bb5513525eb55b5367db819cd4eb9810cb7444985f6b579567a","observation_id":"9727e838-16b8-4ad5-b237-1788a8b561ff","resolution":{"observed_at":"2026-08-16T11:53:01.908050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.885544Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"0439bb34-7272-45a8-9d83-e02a3a6c1dc6","year":2021},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.143511Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:2587b3a85523b0a5d8bf077118132ab3f81f043b9ff2ce66b19319ea847a692e","observation_id":"69adc038-f660-44f9-b7f4-27ad234afac9","resolution":{"observed_at":"2026-08-16T11:53:01.891547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-16T11:53:01.147624Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.147624Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:6de5e762c3ce43321d649031f8f08dbfa18717526295ed53a13a2aafdd4bda60","observation_id":"53acd390-7574-4ba7-b50f-d3af457f750e","resolution":{"observed_at":"2026-08-16T11:53:01.147624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T11:53:01.151813Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.151813Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:db53c9e89a4072a861139358e41cc3812ab046688af09a097277f6ccfcfe7c07","observation_id":"62ff7709-975a-40ee-8763-a6574ccff3b1","resolution":{"observed_at":"2026-08-16T11:53:01.151813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T11:53:01.155987Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.155987Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:3d8c9ae0a2b84ac1fb8b7dd4d34a199b633214fffd919f383979eb8c725d4419","observation_id":"056694e6-9ce4-442f-9bfa-a5f452209657","resolution":{"observed_at":"2026-08-16T11:53:01.155987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T11:53:01.160345Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.160345Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:6343e0942edb91bc8c62a42d5a8e9ec02b0a2ae9e22565bdc1c4b58fa4cf0c85","observation_id":"0a4cadb3-24cc-453a-8095-56a4ab63a266","resolution":{"observed_at":"2026-08-16T11:53:01.160345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-17T16:14:50.126982Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-16T11:53:01.164655Z","title":"Moviechat: From dense token to sparse mem- ory for long video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.164655Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a9191895cdfee086584f398513697761b897ad740adab642603e1e679737737e","observation_id":"03ea62b9-90c1-4cb6-8c93-f6389d52ae93","resolution":{"observed_at":"2026-08-16T11:53:01.164655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.871139Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"839ca313-7b37-43c5-9a79-0814577fb54e","year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.169251Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:b8cfed9a084be7a73e9ee742a614022c64e8949638fe63c3335ad2a1b8e80ade","observation_id":"f254d20a-cbfa-475c-891b-cab57b1d8224","resolution":{"observed_at":"2026-08-16T11:53:01.875686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.173628Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.173628Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:269dea4d64534d14f38d4aabaf69e7febdaf5b10b3ea020215b965b51680ebd1","observation_id":"3e539da7-a84f-433b-a24a-2d6638754125","resolution":{"observed_at":"2026-08-16T11:53:01.173628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.848554Z","title":"Joint learning of attended zero-shot features and visual-semantic mapping,","venue":null,"work_id":"c5214896-a81f-4ad0-bf5b-7791b099d796","year":2019},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.177846Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:63e65b89e73030f71b9e2079917f8defc3a9cf15584fa7bd158c60d35eb2e937","observation_id":"37d98bee-ba20-498c-9bd2-637a8cb93ba7","resolution":{"observed_at":"2026-08-16T11:53:01.853032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08641","last_updated":"2022-07-13T00:21:46Z","snapshot_observed_at":"2026-08-16T19:05:15.880367Z","submitted_at":"2020-11-17T14:00:30Z","title":"A Review of Generalized Zero-Shot Learning Methods","version":5},"cited_work":{"arxiv_id":"2011.08641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.08641","snapshot_observed_at":"2026-08-16T11:53:01.410779Z","title":"A Review of Generalized Zero-Shot Learning Methods","venue":"cs.CV","work_id":"b13a57f7-512c-4e24-a6e1-ba35b937a7b7","year":2020},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.182322Z"},"links":{"cited_paper":"/paper/2011.08641","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:d3d56fc249f85d9559bda2eb2375e765deb3434374fee19934fea342d9903653","observation_id":"20177b18-fcaa-47fa-9e5d-44a34325ea9c","resolution":{"observed_at":"2026-08-16T11:53:01.415927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.834077Z","title":"Learning a deep embedding model for zero-shot learning,","venue":null,"work_id":"232a5020-c33c-462a-bd65-2900486419c1","year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.186865Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:070e4f922d7f377036850db101872048a6d0cd0637ba0fe3216f078a89962c1b","observation_id":"89429e84-b8f8-4fef-98a3-303e0fb326eb","resolution":{"observed_at":"2026-08-16T11:53:01.838532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.191017Z","title":"Video question answering via gradually refined attention over appearance and motion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.191017Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:9c537c235c9e77b7d5831fb97425d20861af44dfced5062c05c6dd0b0298c15b","observation_id":"75935a25-512b-4e67-b893-7fbb54d1b0c1","resolution":{"observed_at":"2026-08-16T11:53:01.191017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.809866Z","title":"Tgif-qa: Toward spatio- temporal reasoning in visual question answering,","venue":null,"work_id":"f7fd71f1-d60a-4980-be5e-8af6f68daa26","year":2017},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.195248Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:b89b6abcc53cc8b1af37eb505e346e2cf1e7b476c913c1dad3db4f807dfe2538","observation_id":"bb6fc5cb-8e23-4633-ba85-5cd65e039f23","resolution":{"observed_at":"2026-08-16T11:53:01.814518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.199459Z","title":"Activitynet- qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.199459Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:9dd298befef3a7b2eb32e935f9f29e06074f6771099404c9b1e0e74d751ddc30","observation_id":"7b1f0db8-c479-4411-be56-cef475623f71","resolution":{"observed_at":"2026-08-16T11:53:01.199459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.786845Z","title":"Latent dirichlet allocation,","venue":null,"work_id":"f3053b5e-2a43-4247-92b8-de48490e36ce","year":2003},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.203711Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:4411f40b06caeb5b8685e6ab1a07d3391a92e9201de77474b311d0c92fc3b1fd","observation_id":"7656832f-b8f0-424e-924a-f9683f859924","resolution":{"observed_at":"2026-08-16T11:53:01.791105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.773104Z","title":"Efficient estimation of word representations in vector space,","venue":null,"work_id":"d9c10c75-6e12-463d-8a23-bb6afb7ff875","year":2013},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.208665Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:43fed0c70bb60f57937d22915a81876e5cbca246dbd6e57e1d850da0cc0cf861","observation_id":"f78adb90-cac7-48a7-bdfb-27a7dd9b51ac","resolution":{"observed_at":"2026-08-16T11:53:01.777599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.759463Z","title":"Skip-thought vectors,","venue":null,"work_id":"e027bd47-4e4a-4be8-8234-5890ac273d11","year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.213243Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:915c9ccef4cd5320881f1a5ee5ad4485bcc1cf18cc7f6d8e8d6fae083b6e9681","observation_id":"93315135-3f80-4e4e-b595-389b4aede8e1","resolution":{"observed_at":"2026-08-16T11:53:01.764174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.745880Z","title":"Distributed representations of sentences and documents,","venue":null,"work_id":"fbcd8f69-5374-4bbb-9f99-4e84d931b071","year":2014},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.217700Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a3deffc9c65f604f2a3b0593b0abafcaffa5aed2fa68bf4971a7f79007b3fe34","observation_id":"38ce0715-2bf0-48d1-bfe7-6d0469f846b7","resolution":{"observed_at":"2026-08-16T11:53:01.750315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.732096Z","title":"A neural proba- bilistic language model,","venue":null,"work_id":"dbc0c8fd-231a-482c-a17e-fe288db6af66","year":2003},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.222235Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:f4e0d979172da3f9240b4a45ed92cdf43eb90c845ec04347ba997c5ee151c8d2","observation_id":"ff98a2ae-8787-494f-a374-ab359de1a45e","resolution":{"observed_at":"2026-08-16T11:53:01.736459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T11:53:01.226446Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.226446Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:5349187c3a265e28bbef9875eaf3d73b9a2a287c627fe440ba20143c67ee40c3","observation_id":"0c37b4dd-802a-489e-a702-936c6219f618","resolution":{"observed_at":"2026-08-16T11:53:01.226446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06755","last_updated":"2022-03-07T12:15:15Z","snapshot_observed_at":"2026-08-16T17:21:28.458070Z","submitted_at":"2022-02-14T14:23:36Z","title":"Energy Tank-Based Policies for Robust Aerial Physical Interaction with Moving Objects","version":2},"cited_work":{"arxiv_id":"2202.06755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06755","snapshot_observed_at":"2026-08-16T11:53:01.374057Z","title":"Energy Tank-Based Policies for Robust Aerial Physical Interaction with Moving Objects","venue":"cs.RO","work_id":"0636269a-f236-4fa1-801e-3d93bb7e8b10","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.231020Z"},"links":{"cited_paper":"/paper/2202.06755","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:2aee6cdd9b9a385e962b3ff12b020e5f17e9de26204497246e7fe73e46a8c640","observation_id":"d05b9459-8a23-4a8a-bee2-7e4da5c94e42","resolution":{"observed_at":"2026-08-16T11:53:01.380764Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T11:53:01.235484Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.235484Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:f4c4a29371bb7306bcc3ad4b6367b312cef6a94dd08ae7ab891aa744bf07196b","observation_id":"d39ae4f1-3396-4ae7-b745-98df744e60bc","resolution":{"observed_at":"2026-08-16T11:53:01.235484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.717122Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":"818d7977-1f26-4c47-aebb-7e50667982ee","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.240051Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:605d903ba7e7227e8ccb0d3d9c2e48a019901fb9e445f8b2fcf6aabb760cc863","observation_id":"70888efd-2d1a-42eb-b88f-26df1aec08d8","resolution":{"observed_at":"2026-08-16T11:53:01.721945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.704291Z","title":"Towards general purpose vision systems: An end-to-end task-agnostic vision-language architecture,","venue":null,"work_id":"085ff7be-bc94-498f-b6e9-940395b382e5","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.244201Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:71634b46acf03576daff45068932a0df19ddd5c616d237a8905ec4ba1798aa32","observation_id":"b99605de-16e8-49a2-8595-5a15dac97fdf","resolution":{"observed_at":"2026-08-16T11:53:01.708291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.690063Z","title":"Class-agnostic object detection with multi-modal transformer,","venue":null,"work_id":"2886ae44-3e9f-4ff0-9e2a-1760e0e35dd8","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.248550Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:c63290a8825dd26ea0dabf4cf13a28adbe1a684e157c5719dd2101d497b898a2","observation_id":"1318fc6c-a02a-4ad8-893f-e3974fc55ec3","resolution":{"observed_at":"2026-08-16T11:53:01.694600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.675821Z","title":"Bridg- ing the gap between object and image-level representations for open- vocabulary detection,","venue":null,"work_id":"c3750c00-5581-4c7c-9f60-dfb3bd7c3d95","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.253078Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:c2cfbf280f33b17d4065bf81292c85e878a6eafd0617f753b0a05c3e4535b4e9","observation_id":"ad11aa57-caf0-4881-8015-e5d4f645d8a4","resolution":{"observed_at":"2026-08-16T11:53:01.679889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.661813Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip,","venue":null,"work_id":"6a29a0db-41c2-4d10-9b49-d548f198bdf1","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.257286Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:921f0f79b94a3edd66c8254a5c9f65e012d5d52703e8bd1d5fb698d3e0b60d74","observation_id":"c466c31f-8346-4db8-8666-49e04d9a59b0","resolution":{"observed_at":"2026-08-16T11:53:01.666490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.647487Z","title":"Language-grounded indoor 3d semantic segmentation in the wild,","venue":null,"work_id":"586d7d24-40ed-4b3b-a8fb-42377e1a6b78","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.261324Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:c0b8109b072535a251bd5ea17a94b1e885cd41103898fcd70cc98319b963343f","observation_id":"83e32dad-0985-4a08-afed-7c6f3a8c4d07","resolution":{"observed_at":"2026-08-16T11:53:01.652301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.632508Z","title":"Expanding language-image pretrained models for general video recognition,","venue":null,"work_id":"b14c94c7-574c-4d9c-a4a8-98c95888dbdc","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.265658Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:a089ba1f09588221378f856a1389875d902899397a55aa0dec5e9358fe88a522","observation_id":"bdd060f2-07d9-4739-9535-d14d05633eaf","resolution":{"observed_at":"2026-08-16T11:53:01.637665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-08-18T03:30:52.103954Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-16T11:53:01.269990Z","title":"Actionclip: A new paradigm for video action recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.269990Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:6d4a7eabedaa0ffc2f78b9787d058bb7a36928a3797c148fd3fa1083702942f8","observation_id":"ec746aca-0426-400e-9372-d412337a601a","resolution":{"observed_at":"2026-08-16T11:53:01.269990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.617983Z","title":"Finetuned clip models are efficient video learners,","venue":null,"work_id":"91309745-80be-4530-9e80-89e719d8bedf","year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.274197Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:faee49c7de5497afdf48d98a149d28cc46ceb15251a66ccb558107f6fdb5827c","observation_id":"a46ef225-0370-40f3-8308-8689c32b7d34","resolution":{"observed_at":"2026-08-16T11:53:01.622589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.278352Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.278352Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:2fdd93b43d038011d3a7b1649a1dd535833da1581de2e965b00ed2d1692027da","observation_id":"8417e37e-6722-40b1-9afb-9a3f9743a26e","resolution":{"observed_at":"2026-08-16T11:53:01.278352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.282427Z","title":"Temporal segment networks: Towards good practices for deep action recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.282427Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:0d354aa981e32324406c39e542fea446239f10b1f74573adf2112f4197b14c4d","observation_id":"e0eebc19-9393-4a68-9cad-bba3fedf1478","resolution":{"observed_at":"2026-08-16T11:53:01.282427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.585087Z","title":"Activi- tynet: A large-scale video benchmark for human activity understanding,","venue":null,"work_id":"fcc37c00-cf4c-44e3-954e-b80d4caf38dc","year":2015},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.287245Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:987cadcb8b62242df0fc66d1235a6b7e6766b082f5556b83d0046ae2b4647bc8","observation_id":"0604e75d-9422-4794-ab3b-cc9e8cf058a7","resolution":{"observed_at":"2026-08-16T11:53:01.590115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15785","last_updated":"2024-06-27T12:05:48Z","snapshot_observed_at":"2026-08-16T14:57:08.115850Z","submitted_at":"2023-09-27T16:58:35Z","title":"BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15785","snapshot_observed_at":"2026-08-16T11:53:01.291124Z","title":"One for all: Video conversation is feasible without video instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.291124Z"},"links":{"cited_paper":"/paper/2309.15785","citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:831a9e759e35e7ddbb790b639d238eca11ff5bb79bffd7f4804ff11562734a10","observation_id":"0ba76b65-e53d-49a9-8a97-f5deaed3158c","resolution":{"observed_at":"2026-08-16T11:53:01.291124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:01.570533Z","title":"Zero-shot video question answering via frozen bidirectional language models,","venue":null,"work_id":"7973fe24-95b2-44ee-a615-db94dcf18556","year":2022},"citing_paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:01.295207Z"},"links":{"citing_paper":"/paper/2504.14432"},"observation_digest":"sha256:e24f977a0616a605945081207ab6cfc3dc16d5cacc625ea059893f5f4ebaae5c","observation_id":"c0097f47-a2fb-420e-999e-701f5f012d1a","resolution":{"observed_at":"2026-08-16T11:53:01.575169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14432","last_updated":"2025-04-20T00:20:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T06:00:04.410766Z","submitted_at":"2025-04-20T00:20:18Z","title":"ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2504.14432."}