{"as_of":"2026-08-13T13:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97ddb6d0f2ca8ac1c81065af10035602e46a98d43c354a0270fe46db1f0cc620","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:06:05.171159Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14688/citation-record","integrity":"/paper/2411.14688/integrity","json":"/paper/2411.14688/citation-record.json","paper":"/paper/2411.14688"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.828160Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.828160Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:5e924649d4b5d00d03533de92afe842422226c07d13e5b2dbc31f86b04d1269c","observation_id":"9fc1bf43-b827-4330-835c-6a2b45ab28c6","resolution":{"observed_at":"2026-08-12T15:06:04.828160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.421224Z","title":null,"venue":null,"work_id":"92555f93-caca-424a-808c-6255117ec726","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.833355Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:5d26a49885fd04d089927bdfe75423cb2b9e5dc713bba4a6b82d835f3324f9e9","observation_id":"58eda270-95ed-4593-814f-882abfb3470e","resolution":{"observed_at":"2026-08-12T15:06:06.426126Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.837965Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.837965Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:64040ee530961086474cddfc68a7fce8653ba9a94c3a8bf10837b053bda936ac","observation_id":"c5f0066a-1638-40ab-93fa-266c263e0cce","resolution":{"observed_at":"2026-08-12T15:06:04.837965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-12T15:06:04.842945Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.842945Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:54f4bac3515bbb950eff83a4f414e959ec6f471fbf50af32ace29eacce9af280","observation_id":"1281e890-ec4b-4755-ae78-099640dadade","resolution":{"observed_at":"2026-08-12T15:06:04.842945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.397606Z","title":"Recur- rent memory transformer","venue":null,"work_id":"2b5c34bd-7368-4a9a-ba81-e092314fe88d","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.847643Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:6d69b7e78eae4631253f458f1a911eec8223f5e310ace212eb3eb427a8b61180","observation_id":"3f418b2a-b1fa-4535-bbab-388e3ab1876d","resolution":{"observed_at":"2026-08-12T15:06:06.402403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.852261Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.852261Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:d73cb26076bb70624b38e13f6cfdebf8533d0ee01cc348e4cd651cad462a53dc","observation_id":"4b1e360d-70a1-4761-97a5-f603fb9458dc","resolution":{"observed_at":"2026-08-12T15:06:04.852261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-12T15:06:04.856994Z","title":"PaLI-X: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.856994Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:771380ae743dc975c2da290633c4409fa00113ebdf90516f84139ea550cb0bf8","observation_id":"0933075a-1a6f-4b96-9f7e-6a0273406282","resolution":{"observed_at":"2026-08-12T15:06:04.856994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.373982Z","title":"PaLI: A jointly-scaled multilingual language- image model","venue":null,"work_id":"43ced058-063c-49d1-ae2e-ccfdc2f29a34","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.861858Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a251c3865c02181e21b27ee9984edf3031af17bee89f60b17201ce5baed1275c","observation_id":"61cdd851-19ad-4708-b862-1df2747700ec","resolution":{"observed_at":"2026-08-12T15:06:06.378746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03204","last_updated":"2023-05-04T23:27:21Z","snapshot_observed_at":"2026-08-13T11:48:58.488724Z","submitted_at":"2023-05-04T23:27:21Z","title":"VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03204","snapshot_observed_at":"2026-08-12T15:06:04.866401Z","title":"Videoofa: Two- stage pre-training for video-to-text generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.866401Z"},"links":{"cited_paper":"/paper/2305.03204","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:001698d8bbb7d25d8fe5b44fc74f6ca762bcb64f112ba7af6b26ec6c39ee76b0","observation_id":"322233ca-9b62-4e1c-8271-0d32a8f6c89e","resolution":{"observed_at":"2026-08-12T15:06:04.866401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.359824Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"ba261ba4-af34-4a26-86d5-abd9db008e73","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.871346Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:95399f62e839e01fa10c8aeb21fbf29db013288aeba875090c76b720afef9325","observation_id":"476c7f7b-ebdf-4ebc-b6aa-c61fb20c7ffa","resolution":{"observed_at":"2026-08-12T15:06:06.364399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01680","last_updated":"2022-07-26T18:33:10Z","snapshot_observed_at":"2026-08-13T11:24:50.774815Z","submitted_at":"2022-04-04T17:51:20Z","title":"TALLFormer: Temporal Action Localization with a Long-memory Transformer","version":2},"cited_work":{"arxiv_id":"2204.01680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.01680","snapshot_observed_at":"2026-08-12T15:06:05.601024Z","title":"TALLFormer: Temporal Action Localization with a Long-memory Transformer","venue":"cs.CV","work_id":"1d33577e-0c2e-44c3-8fd0-9ded71a15384","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.875901Z"},"links":{"cited_paper":"/paper/2204.01680","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a3afd3f6fde6e441838beee3ab2374ca0a7b90b13c7a7d134aa1ff5c3750b18d","observation_id":"db2c8653-8ef1-4f0a-8d31-e135ea8b7ea5","resolution":{"observed_at":"2026-08-12T15:06:05.606074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.345150Z","title":"Monotonic chunkwise attention","venue":null,"work_id":"2297c1e2-3ed0-4cca-80d1-93f110164b91","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.881088Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:9a92196b5c749deede4358a2be5b10a97cbd639397704a730d1f7ea202b46933","observation_id":"62d8344d-51fd-4c6b-bae4-521dc7e62b3d","resolution":{"observed_at":"2026-08-12T15:06:06.349731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-12T15:06:04.885366Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.885366Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:907a2b811e69eefa64f0e76390e804c5912f64b99fed1d20e334f79844383ecb","observation_id":"2f2ed543-2ca6-41ab-bcd2-41e67c5c429a","resolution":{"observed_at":"2026-08-12T15:06:04.885366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.330336Z","title":"An empirical study of training end-to-end vision-and-language transformers","venue":null,"work_id":"a0cbd52b-7620-4022-ae92-6ed02525268d","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.890245Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:aef3fda4241709128e65758909d54bbbce92b30fe06e86a4cc7a2df9e0cb416a","observation_id":"5b6b29fb-8f0a-4264-899a-69afab6caf9c","resolution":{"observed_at":"2026-08-12T15:06:06.335076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2111.1268","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.561309Z","title":"Violet: End-to-end video-language transformers with masked visual-token mod- eling","venue":null,"work_id":"a4d32296-397c-45f1-bc74-f780c60ea267","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.894546Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:4fcb993f1b6d3357bc1f2f6e1c7c778d4b140132f93b3aaef8043e2d487cd16d","observation_id":"64219baf-12c1-41bb-b565-5477d750100b","resolution":{"observed_at":"2026-08-12T15:06:05.568804Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.898868Z","title":"Soda: Story oriented dense video captioning evaluation framework","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.898868Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:989c0911a0f25bc5654116119039c360744b2bcf54658f300f4b0edb8218abe3","observation_id":"8dd6f2c7-edaa-4208-9707-51c3bd6387fb","resolution":{"observed_at":"2026-08-12T15:06:04.898868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.306103Z","title":"Mist: Multi-modal iterative spatial- temporal transformer for long-form video question answer- ing","venue":null,"work_id":"680b2e31-1ecf-4896-b97b-680f5cd43fc8","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.903286Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:baf6ff919825dc8e9eda6cba1e583aeac512dd839a0aa97eabc3b9ebcb0aef0c","observation_id":"bf836ebb-e58f-4baf-9c41-2d409e04da11","resolution":{"observed_at":"2026-08-12T15:06:06.310920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.291609Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"d476a7b7-a611-4ca0-a261-a0aae7c94815","year":2017},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.907497Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:65f1354267d3fed4aff1fa8655f6ac3c7e679eba2bb399255d3a6265a819fe42","observation_id":"779e2d54-5c99-4f82-aec2-59951c501850","resolution":{"observed_at":"2026-08-12T15:06:06.296440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.277142Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"f430b3fe-9f6a-41ec-be42-3196596ff3ae","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.911726Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:d1316209dc913325f3a04cc6a470a299b603002c7b0273146ccef9c4cdf2158f","observation_id":"cb1b91ff-dee4-45ba-bdee-9f5c0a287456","resolution":{"observed_at":"2026-08-12T15:06:06.282074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.263189Z","title":"Multimodal pretraining for dense video cap- tioning","venue":null,"work_id":"6612dde9-5401-457e-95cf-8106559fe16e","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.916036Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:27843cfb0bdedea73a545a74042493d227d9e147cba6df94a214942b3fe8532e","observation_id":"eb4d5fbf-0614-410f-b635-255f322addb1","resolution":{"observed_at":"2026-08-12T15:06:06.267858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.248788Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","venue":null,"work_id":"7e9b4081-150c-42e1-9b13-016f10a33e78","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.920357Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:42c891fa9e1d67a8fabfa2c6e1dac68d7970041ad7906321f7140f4559da9ccb","observation_id":"e534e57a-ec11-4924-91e7-549b3c17c99b","resolution":{"observed_at":"2026-08-12T15:06:06.253553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.234009Z","title":"Long movie clip classification with state-space video models","venue":null,"work_id":"6e085770-5132-4753-94e2-fd43cea19388","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.924749Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a550eac8f9ce841f86938228b3bdf7bd45a3164eaefa36b90ef6d04ce29c1542","observation_id":"28f5fd1d-56f8-48f4-a619-f5a5ca7e567b","resolution":{"observed_at":"2026-08-12T15:06:06.238572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.218526Z","title":"Perceiver: General perception with iterative attention, 2021","venue":null,"work_id":"0979c4ba-d489-4b30-adae-e7ce86d0c82f","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.929930Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:f1c2ecef9759198715deff42ac9fce3dd6f810fcbce1a345d5817998f31ff7e8","observation_id":"2ebbb894-1c9c-47ea-a25e-cc09b23d77d6","resolution":{"observed_at":"2026-08-12T15:06:06.223759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.202952Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"64964cce-9904-477b-be68-cc2c50c7b6df","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.934248Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c7ea29788137c2f2b699530acf7b21cebb5d9206278f9cee729b305a5b750d5f","observation_id":"866920ec-e48c-4654-a1d0-197ef9477bd4","resolution":{"observed_at":"2026-08-12T15:06:06.207617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-12T15:06:04.938660Z","title":"The ki- netics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.938660Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:504e2bd9f40f011aebe9a1ab270d75a2c95c394325ec10730534cc0207f367c2","observation_id":"634c3a2a-8ba3-4870-b3e7-b5d1ada9c606","resolution":{"observed_at":"2026-08-12T15:06:04.938660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.187585Z","title":"Dense-captioning events in videos","venue":null,"work_id":"848c7d30-139e-4c36-811f-0ba769f8f9d0","year":2017},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.943485Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:854505dd57bb311ee389cb4be078f494cf04f60587ad35301e04b2d02a9ef1a7","observation_id":"7b2d3f33-9c37-433f-b9a0-d5471995577a","resolution":{"observed_at":"2026-08-12T15:06:06.192583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.172461Z","title":"MaMMUT: A simple architecture for joint learning for mul- timodal tasks","venue":null,"work_id":"b0988d6a-1d35-4098-97cf-e85f8ea60577","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.948145Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0458064781f2f99be184929651d45e2646d74ef96670f47fc94e071a0c9dac5a","observation_id":"ab86b914-033e-4fe5-86ec-c876dbe04c34","resolution":{"observed_at":"2026-08-12T15:06:06.177370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.157243Z","title":"Selvaraju, Akhilesh D","venue":null,"work_id":"8b29cea9-7b7f-432f-9d06-b5802176288f","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.952500Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:255fc2ce75a60841609ac977441bda128d6e060dc901d5c6d5f8ef23bd367bc4","observation_id":"93a06bfb-34e4-4d4f-81f5-7c577724b57e","resolution":{"observed_at":"2026-08-12T15:06:06.162380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-12T15:06:04.956799Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.956799Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:95cacba07df74e3a7f751901379d5ae5477463d67cf995b50aebae3edae427dc","observation_id":"2073b075-6195-4090-a649-687ad2ea368c","resolution":{"observed_at":"2026-08-12T15:06:04.956799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.141960Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"9abcc6c2-3d54-4aab-991c-1a9decd984da","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.961415Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:4282475f59a957ad76fe876781c9d3da0e900e4e50f3327729f2ba95966e2dbb","observation_id":"16497643-3609-4795-953f-103946ee1173","resolution":{"observed_at":"2026-08-12T15:06:06.146858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:04.965854Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.965854Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:e70361ad7945db361b308fd489dbfeea542aaf804b5f44c0eb9d2a19c153684f","observation_id":"ccea7bdf-7641-42e0-b7ec-5256e04f62a9","resolution":{"observed_at":"2026-08-12T15:06:04.965854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.118409Z","title":"Eclipse: Efficient long-range video retrieval using sight and sound","venue":null,"work_id":"21bbf8b5-bc4f-4019-be1c-084fea095b17","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.970155Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:dc5d4e325f61c80723f1ef2ba04cdf850a3f6940b8d3bdbf405d9b95760e60df","observation_id":"259d49b3-f1ee-41eb-aaf1-d1695b76edfe","resolution":{"observed_at":"2026-08-12T15:06:06.123020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.103931Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"3df22481-5efd-452d-b3ef-d441da9f3143","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.974651Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a10b9c56d2e016fb36c35bec73dd0f15606222053c24591f09be356f4908e3c8","observation_id":"508faf4f-05af-4693-85a3-1d318c14ad52","resolution":{"observed_at":"2026-08-12T15:06:06.108611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-12T15:06:04.978924Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.978924Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:51d9e9aa84c3ab19765fd4b2221856e077cce228de07fd40b78a0220716659cd","observation_id":"4a015e24-5651-49eb-89cf-2299cc5cf88a","resolution":{"observed_at":"2026-08-12T15:06:04.978924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-12T15:06:04.983697Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.983697Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:8f1c40481682af6a2862ad958e60419927d9c4aa937b7ba1bcf20bea07ca16e1","observation_id":"2e37f6b3-5420-48b1-8ef4-4ef8f2d6b586","resolution":{"observed_at":"2026-08-12T15:06:04.983697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-10T14:43:16.360554Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-08-12T15:06:04.988340Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.988340Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:048e7391319ced9ed09a841e46ffbdae8b140a6baf424f718c6fac62848a3b43","observation_id":"544c7b6c-8643-477f-b6c9-ee214541a8b9","resolution":{"observed_at":"2026-08-12T15:06:04.988340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.089900Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"5178c0f5-84e1-4537-ba02-d761f9b0d680","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.992820Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:45146739c638ae8aba60485a7dba02bd9aed2e7d802879c377563e52c293d5da","observation_id":"f99164ad-09ba-48b6-9d4f-52c978b8cdf9","resolution":{"observed_at":"2026-08-12T15:06:06.094585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.075561Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"569ab867-d829-4e41-8197-be38798d6404","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:04.997164Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:67727acfc25b29cc5900cf91a2fc727e1395995d6e840ea25a29210c3b52efb6","observation_id":"e7c291c4-96bf-4303-ba3f-4eaafe0b1ad6","resolution":{"observed_at":"2026-08-12T15:06:06.080134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.060965Z","title":"Re- thinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"dcb9e951-0564-4ae6-9593-de9952dfeb83","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.001535Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:25337b9ec56693bffc36af43b2664f4d2c1d90802e6377c80def134ea68cf4e0","observation_id":"269d64be-8381-4c1f-bdfe-c09523415829","resolution":{"observed_at":"2026-08-12T15:06:06.066168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.045945Z","title":"Dynamic pretraining of vision-language models","venue":null,"work_id":"65d96a93-ff32-44df-9b8d-746419e4b6b8","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.005634Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:688ba9067c04354b4c6142b9370538759e8aac1f71e93fc9308e277c38e5db6f","observation_id":"6df7cbe3-23f8-48ea-8e27-a3e6b204789d","resolution":{"observed_at":"2026-08-12T15:06:06.050986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.030560Z","title":"Mirasol3B: A multi- modal autoregressive model for time-aligned and contextual modalities","venue":null,"work_id":"3f2056b8-a31b-400c-bfbb-a5f5acdec317","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.010128Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:fe77f78085d9028f88fa7ce1d26310ed06fd20cbc9f84ba3de5e40d6a5fb96ce","observation_id":"4c1d06c5-315f-4441-b52c-d889c3de41f7","resolution":{"observed_at":"2026-08-12T15:06:06.035370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.015513Z","title":"Timechat: A time-sensitive multimodallarge language model for long video understanding","venue":null,"work_id":"0ea74467-7861-454c-b374-5774876d4561","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.014494Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:de633d2d324057235d1d030e38de5a8af21647e539990abd35c895b49fe0a18a","observation_id":"70723b90-532a-4496-baa8-fe1dbfba2780","resolution":{"observed_at":"2026-08-12T15:06:06.020522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:06.000079Z","title":"Ryoo, AJ Piergiovanni, Anurag Arnab, Mostafa Dehghani, and Anelia Angelova","venue":null,"work_id":"64003429-27f7-498d-87b4-4dc4b1deb3e4","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.019001Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c1a6296364783c02781ade28e74f57f0f74725cb2b88acbf45b953ad38cc61fe","observation_id":"eecb69be-a250-46cb-a0e7-46e88aa337b4","resolution":{"observed_at":"2026-08-12T15:06:06.005351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.985315Z","title":"Ryoo, Keerthana Gopalakrishnan, Kumara Ka- hatapitiya, Ted Xiao, Kanishka Rao, Austin Stone, Yao Lu, Julian Ibarz, and Anurag Arnab","venue":null,"work_id":"8e2afb36-8d8b-4d2e-abd5-4cc5f3945f79","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.023173Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:d578fb8744eb1480c0270bd893d30fb49e7d214d8dafdf24e94ca8bf165a0901","observation_id":"682ac631-1b37-4e47-9e54-d74537cbd27b","resolution":{"observed_at":"2026-08-12T15:06:05.990104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.970846Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"f825d455-bf6f-4f7e-ac8f-e7050767779b","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.027594Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0393fedcf0533324cf7d3b4e33cdc96bbf4c671c08f53a23370c991e7383e77c","observation_id":"fe32cb33-f5a8-42cc-9296-cf38edf05b5b","resolution":{"observed_at":"2026-08-12T15:06:05.975563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.032048Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.032048Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:62b0ec289925be72cb78b96e825278ad9df484f3a4f0cd7666aeb1a6f00072f7","observation_id":"6873270e-a51b-4777-aa9c-5a4191ca1ef4","resolution":{"observed_at":"2026-08-12T15:06:05.032048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.947390Z","title":"Ucf101: A dataset of 101 human action classes from videos in the wild","venue":null,"work_id":"89a5f83a-5d26-4761-bc92-9925ae779cd2","year":2012},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.036535Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2e504317c9b19c5a59e4181217e11514b7a745e537496cb7f8c76faf76696b0d","observation_id":"cc54361f-70fe-4445-813e-2264bf0e17bc","resolution":{"observed_at":"2026-08-12T15:06:05.952057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.932324Z","title":"Long-form video-language pre- training with multimodal temporal contrastive learning","venue":null,"work_id":"ca3f738a-317c-455d-9768-8e0776f3dc49","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.040934Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:33cc0f8cde11ed5d5e36c86d1858a408d2206355611ea67212474a0f3dcce585","observation_id":"26e32ad5-2ac1-43f4-ad44-734d59ebf866","resolution":{"observed_at":"2026-08-12T15:06:05.937238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.917381Z","title":"Lxmert: Learning cross- modality encoder representations from transformers","venue":null,"work_id":"602d970c-5c57-4cca-bde6-58405c3e1907","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.045382Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:625f1d284bccac38ce56b8008a7c256eedac2f602f838fbbfcb8307a5e07ea35","observation_id":"72a9ef8c-a6be-41f9-87f5-904215e960a3","resolution":{"observed_at":"2026-08-12T15:06:05.922326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06615","last_updated":"2021-10-13T10:17:06Z","snapshot_observed_at":"2026-08-05T04:10:00.715983Z","submitted_at":"2021-10-13T10:17:06Z","title":"CLIP4Caption: CLIP for Video Caption","version":1},"cited_work":{"arxiv_id":"2110.06615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.06615","snapshot_observed_at":"2026-08-12T15:06:05.347504Z","title":"CLIP4Caption: CLIP for Video Caption","venue":"cs.CV","work_id":"93cadd35-2363-47e4-8fee-909746aabc68","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.049820Z"},"links":{"cited_paper":"/paper/2110.06615","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:fd6bbcd1190eb7bec33cc0edb56674939103ec3235ac89900770295fba72b05e","observation_id":"eb9d6011-49f0-4598-a980-1aae07ec971d","resolution":{"observed_at":"2026-08-12T15:06:05.353751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.054676Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.054676Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:02a1470982debd322c3e4980262fac7d15d764deef5fff1280738ae2eeb9399c","observation_id":"abaf2d17-1bd9-45b9-b3fa-65160eba14cb","resolution":{"observed_at":"2026-08-12T15:06:05.054676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.893094Z","title":"Bidirectional attentive fusion with context gating for dense video captioning","venue":null,"work_id":"48a17bff-8826-4fb6-9649-9fe19f4195ea","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.058944Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:8b96a2fe8efb0d5f0da255230ff5a0426ce8db6631e0b5f96460307e34d25c2f","observation_id":"84909b79-6f9a-438a-9985-b6e0e2125196","resolution":{"observed_at":"2026-08-12T15:06:05.897753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-12T15:06:05.063232Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.063232Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:1058a9e290adccf5aeb7da14209698d7682c7d288e8f8602efcc9acd98814308","observation_id":"ecb8d9d6-4849-4fc7-a288-f1d99e3102e3","resolution":{"observed_at":"2026-08-12T15:06:05.063232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.878222Z","title":"Omnivid: A generative framework for universal video understanding","venue":null,"work_id":"38db4bf4-eed3-4ca5-a9eb-1aee00b7aaf8","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.067933Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:b866dd303cedba337009bec0a3aba0b6ff8f2f665e48dd9bc43f20fda7579640","observation_id":"25f47987-40a1-46cb-8ca5-451b566e3853","resolution":{"observed_at":"2026-08-12T15:06:05.883020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03052","last_updated":"2022-06-01T09:24:35Z","snapshot_observed_at":"2026-08-08T22:07:00.654212Z","submitted_at":"2022-02-07T10:38:21Z","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03052","snapshot_observed_at":"2026-08-12T15:06:05.072176Z","title":"Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.072176Z"},"links":{"cited_paper":"/paper/2202.03052","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:dd89e5bfe946e80f97e117737882a708ad2dfc7a864d67da349986153e14c704","observation_id":"ad699342-6b75-4888-a562-47e8d54a4a59","resolution":{"observed_at":"2026-08-12T15:06:05.072176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.862684Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"aeef804e-d7e2-4a4c-89d8-7448d4905080","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.076799Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:1f47a54aaceae7f90a90ab04473cb65f02f0b62262bb2a699af771ce14170a7e","observation_id":"2844a8a3-3fc3-485b-b257-5efe1d665c05","resolution":{"observed_at":"2026-08-12T15:06:05.867617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-11T00:20:29.155513Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-12T15:06:05.081141Z","title":"Image as a foreign language: Beit pretraining for all vision and vision- language tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.081141Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:528f673dd3b8504c61209433ae4d69a81c5232268944a38e2151bbcab38a0149","observation_id":"3866e6e4-4cd8-4a15-8fd0-c16be4a0a892","resolution":{"observed_at":"2026-08-12T15:06:05.081141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-12T15:06:05.085716Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.085716Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0d1228487bfbdc688af146fa881fcff06af15b5ab09eb907808671f576d9d3a8","observation_id":"77202398-63d6-4180-bcfc-77319f3070f1","resolution":{"observed_at":"2026-08-12T15:06:05.085716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-12T15:06:05.090407Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.090407Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:8563ea22456064b884967b67987d35304862b43f83426bdbae8885bdc2948917","observation_id":"7c79ed25-29e0-4b4f-a0ea-a4ffcf36494a","resolution":{"observed_at":"2026-08-12T15:06:05.090407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.847809Z","title":"Vl-bert: Pre-training of generic visual- linguistic representations","venue":null,"work_id":"97ea6b0a-9e17-456a-a1ef-045db0c5da7e","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.095077Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:27d5890f32ece8ebd5c832ea25dfe786fbdda36a8bc63bd804ab06351e9d3b67","observation_id":"dedb013e-e3c7-44ee-9654-c3856e996084","resolution":{"observed_at":"2026-08-12T15:06:05.852537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.833561Z","title":"Towards long-form video understanding","venue":null,"work_id":"47d9b072-2dbb-43b6-9e9b-ae25de492043","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.099227Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c13cf8927dd234fa0b9dbd5b5a4ec48e77acd11b2a3bfcc22fc29d34b60162fb","observation_id":"3a2d0625-250b-4b1d-a5ab-ee791bbe4902","resolution":{"observed_at":"2026-08-12T15:06:05.838141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.818645Z","title":"Dibs: Enhanc- ing dense video captioning with unlabeled videos via pseudo boundary enrichment and online refinement","venue":null,"work_id":"525e8575-3eb0-4623-9c85-761264760747","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.103524Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:e66df4aed5bb1eccb1fad883b0c8e957c7d3ad1c6648639c688489f24890b3d0","observation_id":"0ffc5d5d-b2d5-41a5-abc9-b57b2ba4d9fb","resolution":{"observed_at":"2026-08-12T15:06:05.823791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00402","last_updated":"2023-02-01T12:40:03Z","snapshot_observed_at":"2026-08-13T12:53:33.421505Z","submitted_at":"2023-02-01T12:40:03Z","title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00402","snapshot_observed_at":"2026-08-12T15:06:05.108091Z","title":"mplug-2: A modularized multi-modal founda- tion model across text, image and video","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.108091Z"},"links":{"cited_paper":"/paper/2302.00402","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:62b1ad348205c17773f4ee1cd611ac38531a920711864f26cfdc2c3bc04a76ca","observation_id":"484716e0-2545-429b-98de-c9ffdd87a54e","resolution":{"observed_at":"2026-08-12T15:06:05.108091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-13T13:24:34.796483Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-12T15:06:05.112688Z","title":"Videococa: Video- text modeling with zero-shot transfer from contrastive cap- tioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.112688Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:2cda67ab9e1909b8841d91ef4734a2c8fc70b29d0b3ca8204a6b8e4a18cd0403","observation_id":"f11a6134-c2e5-4735-9bcf-4d2ba70a9829","resolution":{"observed_at":"2026-08-12T15:06:05.112688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.803395Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"1ab81561-bd3a-4e2e-8488-d04df9045036","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.117231Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:bab0c1f149170a32b6d9d871af0f5e3361ddc5210cffe03d63989a1cafe0fb6f","observation_id":"4ea51806-a878-4d44-a798-21e8c1530627","resolution":{"observed_at":"2026-08-12T15:06:05.808297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.121604Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.121604Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:57d5712bc07b3504368461817c8cdef03059e237f52b39130f52324685e29fe5","observation_id":"f72021f7-070e-4aaa-8326-44b87f8ca744","resolution":{"observed_at":"2026-08-12T15:06:05.121604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.778450Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"98bb2739-3777-47ca-b118-c05ff0d83e8e","year":2023},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.126063Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:fe63e961f13fcf39d491f9de648e3a2cf01406c3d89a9e82ee55bcdbe7f5a131","observation_id":"c5448c75-05e4-445e-9a98-1004fab46069","resolution":{"observed_at":"2026-08-12T15:06:05.783130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.763959Z","title":"Mer- lot: Multimodal neural script knowledge models","venue":null,"work_id":"b03f7fbf-a05f-4f73-b71f-4d0ca419e882","year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.130393Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:662de1c2ce3be024222152524e67670fbd7b66529d3e465cdbf4695a38193688","observation_id":"7cd6d66b-6d22-4bc3-8426-b728a86d9794","resolution":{"observed_at":"2026-08-12T15:06:05.768846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.749174Z","title":"Actionformer: Lo- calizing moments of actions with transformers","venue":null,"work_id":"e9b227fa-97e0-4e1c-94fc-f32c4523cfae","year":null},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.134742Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:a571cb4f379e465f6c06e6b038ad00109b9f96acb751ccc0208f93c9c5bdb323","observation_id":"3c8c9704-693c-4510-a8dd-0692858bcee5","resolution":{"observed_at":"2026-08-12T15:06:05.754096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00529","last_updated":"2021-03-10T01:27:16Z","snapshot_observed_at":"2026-08-03T19:27:03.174412Z","submitted_at":"2021-01-02T23:35:27Z","title":"VinVL: Revisiting Visual Representations in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00529","snapshot_observed_at":"2026-08-12T15:06:05.139120Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.139120Z"},"links":{"cited_paper":"/paper/2101.00529","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:ddf6b1f8a0fecad49d7abe6e2b86a95851a56f1baa270cc441180ff759a68d00","observation_id":"3faccc33-6290-4dae-ad00-4adfd538343c","resolution":{"observed_at":"2026-08-12T15:06:05.139120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.733432Z","title":"Unifying event detec- tion and captioning as sequence generation via pre-training","venue":null,"work_id":"44d97d7a-4187-417f-aa7e-a62fc0abf5df","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.143718Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:974d2addf6a56a10f58bb359de7f9f2d7a9f6270463290a326bf4b61a4c27275","observation_id":"113ed232-ae2d-4a3c-bdd6-b7a0a89bc616","resolution":{"observed_at":"2026-08-12T15:06:05.738616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.718053Z","title":"Open-ended long-form video question answering via hierarchical convolutional self-attention networks","venue":null,"work_id":"18b8cb3a-ce53-42a1-ac14-bc14017bae81","year":2019},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.148081Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:440c7639bec028348b01571838c3d170632cc905e3ae94389e16647b152cf031","observation_id":"786bfcf7-53f3-4260-9b5d-ef716e770842","resolution":{"observed_at":"2026-08-12T15:06:05.722709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.703511Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"6eaa8498-a1ad-4775-a85c-8a5483aeba15","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.152827Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:53acf8e63b51fd1406c6fe70eaba1661bf47eb6324a620aa3d04eab1a3668d4a","observation_id":"d6f167a0-1b80-45b5-8251-af197a0a4cbf","resolution":{"observed_at":"2026-08-12T15:06:05.708283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.689025Z","title":"End-to-end dense video captioning with masked transformer","venue":null,"work_id":"d435c9d3-0f70-4826-b3c5-c301ae673165","year":2018},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.157215Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:c1fcee63d8080bb6d5b6f91dc3f534cfa6c6b28da59bc967f89b1cbf3bf6c737","observation_id":"01ea6556-418e-491e-94a0-f39784588f12","resolution":{"observed_at":"2026-08-12T15:06:05.693993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.674450Z","title":"Streaming dense video captioning","venue":null,"work_id":"36dee465-ad62-47e7-bffd-b756bd94a858","year":2024},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.161886Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:7d7f810487f946988a3f6d8dc32e2e6bc8a64db9d4b3068a48a555e038543580","observation_id":"4b0e473b-4958-4e01-be53-f7d53ff8bc8b","resolution":{"observed_at":"2026-08-12T15:06:05.679149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03644","last_updated":"2020-10-07T20:45:14Z","snapshot_observed_at":"2026-07-06T10:02:27.415825Z","submitted_at":"2020-10-07T20:45:14Z","title":"Towards Understanding Sample Variance in Visually Grounded Language Generation: Evaluations and Observations","version":1},"cited_work":{"arxiv_id":"2010.03644","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.03644","snapshot_observed_at":"2026-08-12T15:06:05.208857Z","title":"Towards Understanding Sample Variance in Visually Grounded Language Generation: Evaluations and Observations","venue":"cs.CL","work_id":"ea49e53d-81ad-4040-8684-9d19d2312df6","year":2020},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.166374Z"},"links":{"cited_paper":"/paper/2010.03644","citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:0fbf2ac7861a23c95407c9bbbdfb9ba1fbeb8408e3e537f479a6a50d8c1d59d1","observation_id":"981ea771-ddc3-4beb-b52f-4a1c4a08eb2e","resolution":{"observed_at":"2026-08-12T15:06:05.215806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:05.659586Z","title":"Thapliyal, William Yang Wang, and Radu Soricut","venue":null,"work_id":"33759d05-30d1-4621-b17b-4d9998d62f52","year":2022},"citing_paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:05.171159Z"},"links":{"citing_paper":"/paper/2411.14688"},"observation_digest":"sha256:646df4577ae5a71a58d5aa937dd4a90b517c83e6681e6e56624d61a9a5a7b770","observation_id":"6919d268-601d-4346-ab9b-df06ec865e03","resolution":{"observed_at":"2026-08-12T15:06:05.664229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14688","last_updated":"2024-11-22T02:46:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:58:42.271167Z","submitted_at":"2024-11-22T02:46:44Z","title":"Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":47},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2411.14688."}