{"as_of":"2026-08-21T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:943d9f816f02eb7040aad192a4f373d7973070e2dfb6a6e6ca2d82410ac1c0a8","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:59:05.327148Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03426/citation-record","integrity":"/paper/2509.03426/integrity","json":"/paper/2509.03426/citation-record.json","paper":"/paper/2509.03426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.231764Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"ad79f33a-cf20-4a87-aa73-ed5f28d78200","year":null},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.046435Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:54068a23d7b4c869aa71ce039e1876a4fac3d047630bc20d72903db6bfa7ab31","observation_id":"3ef1adcf-14c5-4b03-a712-e911b72d70ff","resolution":{"observed_at":"2026-08-05T10:59:06.238261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.058702Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.058702Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:cfa166ceed52d62d0d822a6859d93b69e28e2e7759976513f48d5483f20cd356","observation_id":"e15d9f35-d9c6-4729-b85c-6ad279a9fa2b","resolution":{"observed_at":"2026-08-05T10:59:05.058702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.195096Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"6bcef2de-c75c-420f-94e5-c8db63357bb3","year":2005},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.064648Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:f62c5a5a666d892c371eaae0f1e130b29b0159a141060b934a0afc479e113bdf","observation_id":"260eb709-a8c2-4dc1-bebb-556f5fdc0e06","resolution":{"observed_at":"2026-08-05T10:59:06.205518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.179496Z","title":"Is space-time attention all you need for video understanding? 2021","venue":null,"work_id":"8673901f-1ad5-406e-beb9-2643219c90a7","year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.070716Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:d9e3d6f317cc5088a98e29d3141a4dc38d0c12e14ffef51ba53485a5ce960b34","observation_id":"79b155be-b617-4707-b39a-7e7b2f728240","resolution":{"observed_at":"2026-08-05T10:59:06.184422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10211","last_updated":"2024-07-31T21:17:43Z","snapshot_observed_at":"2026-08-16T14:18:11.369547Z","submitted_at":"2024-02-15T18:59:43Z","title":"Hierarchical State Space Models for Continuous Sequence-to-Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10211","snapshot_observed_at":"2026-08-05T10:59:05.075845Z","title":"Hierarchical state space models for contin- uous sequence-to-sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.075845Z"},"links":{"cited_paper":"/paper/2402.10211","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:26ba069cfc7f6c53713685c11c42831f4a1a6292dc7cba458ee46573dd4b40ec","observation_id":"d67e6e22-0bf9-4486-9277-49357766d9a5","resolution":{"observed_at":"2026-08-05T10:59:05.075845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.081046Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.081046Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:a521df07194dd1e32640e8e01fe3f95a02d53d156d67979767ffe43b56d7e8cd","observation_id":"b0e15e12-3a49-4a32-889a-51c7eb382f47","resolution":{"observed_at":"2026-08-05T10:59:05.081046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-08-16T14:09:43.089136Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-08-05T10:59:05.085854Z","title":"Video mamba suite: State space model as a ver- satile alternative for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.085854Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:05efe565d9c945af7c53db51c631bddbdc1e48e3e27e6c67265dca22d5bced12","observation_id":"546ba720-7323-449a-8a91-93e2b9098c1d","resolution":{"observed_at":"2026-08-05T10:59:05.085854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-05T10:59:05.091693Z","title":"PaLI-X: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.091693Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:f928b21c311d09f92ea90cd052495d301a13708d8ddbf03f10d241e8a5f106b4","observation_id":"2a4c9b6d-09f8-4b7d-8e4c-6f4da2e4900b","resolution":{"observed_at":"2026-08-05T10:59:05.091693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T10:59:05.096843Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.096843Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:ef2d6fd9eb8017453d738387e19997607c03fe0f99d39ec551d7d24ca13fbdc3","observation_id":"8ee1896d-7be7-494f-9607-160ef8634304","resolution":{"observed_at":"2026-08-05T10:59:05.096843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11227","last_updated":"2021-04-22T17:59:45Z","snapshot_observed_at":"2026-08-16T18:29:40.668904Z","submitted_at":"2021-04-22T17:59:45Z","title":"Multiscale Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11227","snapshot_observed_at":"2026-08-05T10:59:05.102006Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.102006Z"},"links":{"cited_paper":"/paper/2104.11227","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:f5442f5a93643617b52f65d24cbb228f57ef6a2cc7499a29dfb583121bb8d5cf","observation_id":"22a43343-5c80-46be-b353-e8b2756ea021","resolution":{"observed_at":"2026-08-05T10:59:05.102006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.152809Z","title":"Soda: Story oriented dense video captioning evaluation framework","venue":null,"work_id":"1bc89890-6a29-4aac-bc75-5b7779655db9","year":2020},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.107388Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:c23718103e7a9027c8d4cae62c5f11dbd229b7deab14e2c9bd7fde32a0013f86","observation_id":"763d8db4-5f01-442a-b3cb-73fac83ac806","resolution":{"observed_at":"2026-08-05T10:59:06.158015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T10:59:05.112247Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.112247Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:81b96851589180449ac337219427f5e71a1431d75c5e237919a07733cf85f7ae","observation_id":"52a83bc8-c1c2-4693-87f4-c5e46e46ec73","resolution":{"observed_at":"2026-08-05T10:59:05.112247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.136372Z","title":"Combining recurrent, convolutional, and continuous-time models with the structured learnable linear state space layer","venue":null,"work_id":"97f77f24-a53d-4685-8868-c73b10712c22","year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.117319Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:40050aaa78244fda9b9144eb4f2ca7ae726f465247b41c5e484e625d9d0f427e","observation_id":"a4b37c31-0b7d-450d-b761-0c4bacff8110","resolution":{"observed_at":"2026-08-05T10:59:06.142564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.120991Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"c42c382e-b222-4089-9b83-8eb2d3886e55","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.122127Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:9291b67b862c7b560c4b8225c283f542d0e40a1a576398499ae763e45ecf2726","observation_id":"1d47f72a-7a7a-471c-95d9-65e23fb11b7a","resolution":{"observed_at":"2026-08-05T10:59:06.125885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.104876Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":"05ad9fbe-e1d1-4fb3-abb0-b42ed94810f3","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.127507Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:f60bf3a52257cb1a336fdc3d0e53be5a3b3ead63e3827c045ba91f656250ce00","observation_id":"02eb2a0b-fa0e-4a97-89b8-d43a88dba24e","resolution":{"observed_at":"2026-08-05T10:59:06.109945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-19T17:23:30.606512Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-05T10:59:05.132385Z","title":"Videollm: Modeling video se- quence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.132385Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:f1068f796d9a8c94f346c2607f2d0dcd09a21b709dc33aaa1bfa62e4a7be01ef","observation_id":"a96d9ce7-a49e-49c9-a47c-9a59b83bc134","resolution":{"observed_at":"2026-08-05T10:59:05.132385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09407","last_updated":"2026-06-03T05:07:20Z","snapshot_observed_at":"2026-08-20T13:16:21.393906Z","submitted_at":"2024-06-13T17:59:44Z","title":"Towards Evaluating the Robustness of Visual State Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09407","snapshot_observed_at":"2026-08-05T10:59:05.137814Z","title":"Towards evaluating the robustness of visual state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.137814Z"},"links":{"cited_paper":"/paper/2406.09407","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:1cc3abc485d39c3270706d85c2c3c3fd2f40b95e094a7cd4a9d9124bde419788","observation_id":"6d1310a3-123d-4a09-9dc4-db1c334cfdc1","resolution":{"observed_at":"2026-08-05T10:59:05.137814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.084304Z","title":"Ac- tivitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"0a82d38d-4678-40a6-b021-0188ebd5439a","year":2015},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.143278Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:e76c0dfc8cd86f2f6b7670e4b61dd579d3a92a4133b39fc51534bbef79afc6b4","observation_id":"f39f5100-1a88-40ec-81ab-444754944496","resolution":{"observed_at":"2026-08-05T10:59:06.091962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.066518Z","title":"Multimodal pretraining for dense video captioning","venue":null,"work_id":"13a7d8a5-d22d-468e-ace3-b1599ae0f920","year":2020},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.148295Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:ebc90aa291e5fe474aa14876368339c0fb4ed7e80d2f6f5a0cc1fb5e855fe302","observation_id":"b9de3557-d17c-4b82-b232-4570f09191b1","resolution":{"observed_at":"2026-08-05T10:59:06.071800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.050550Z","title":"A better use of audio-visual cues: Dense video cap- tioning with bi-modal transformer","venue":null,"work_id":"19013d92-5729-4391-b67a-4d8ed375dbeb","year":2020},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.153609Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:70bbb5908656f48c0e1a58d373928b31dc9e43aafaf0ca7497baf44c1059aaf3","observation_id":"c800fdae-84fe-43ce-9c00-b1591e5e755a","resolution":{"observed_at":"2026-08-05T10:59:06.055720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.034327Z","title":"Long movie clip classification with state- space video model","venue":null,"work_id":"aabdaf60-c641-4c25-a157-9d1598ac22b3","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.158954Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:23dc07f17061ce71ab83e5dfbbec301f20522134193c2930001cc785a05d3a42","observation_id":"3d29b200-f18b-47e7-aaf1-1ebca35ebf60","resolution":{"observed_at":"2026-08-05T10:59:06.039558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.018873Z","title":"Long movie clip classification with state-space video model","venue":null,"work_id":"df51a6d7-79fb-447e-8914-93f3fc0dd856","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.164858Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:f74e768e6b2f3ca408319e20b37cda897f18705c4aab8d73d54a33caf887226a","observation_id":"b839122e-ee85-4824-b877-f48905c8d382","resolution":{"observed_at":"2026-08-05T10:59:06.023782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-05T10:59:05.169637Z","title":"Linderman Jimmy T.H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.169637Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:c68ce6441c33faefd57ffc33a9ff0592f3a99426abfcbfe1675367dd110c6b97","observation_id":"21afb9be-2d44-4e7e-a02d-34f394414243","resolution":{"observed_at":"2026-08-05T10:59:05.169637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:06.003382Z","title":"MaMMUT: A simple architecture for joint learning for multimodal tasks","venue":null,"work_id":"36ff99be-9efe-4cfc-a40c-ffedf8cbff4e","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.174622Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:66c8ab03e13326db7a1d0f3a537863160aadf7f50c17741f24053e1974294ff0","observation_id":"db29ba23-07d7-49f1-bf0e-4250ac02d87f","resolution":{"observed_at":"2026-08-05T10:59:06.008388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06977","last_updated":"2024-03-12T15:22:52Z","snapshot_observed_at":"2026-08-16T14:10:51.584702Z","submitted_at":"2024-03-11T17:59:34Z","title":"VideoMamba: State Space Model for Efficient Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06977","snapshot_observed_at":"2026-08-05T10:59:05.179915Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.179915Z"},"links":{"cited_paper":"/paper/2403.06977","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:734ea04d2733466a10d1877a9d42abab72aed516748360363e71c2bb0db8b4bc","observation_id":"8b02b6aa-54c2-4cd9-9c75-b4f3705b80aa","resolution":{"observed_at":"2026-08-05T10:59:05.179915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.185580Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.185580Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:738f47d40bf4bb05cd2d0577f7a030784cc4cf2979d2e1dd666dee72b810cbdd","observation_id":"8ab8b26f-5d87-41fa-b6bf-254942890bf9","resolution":{"observed_at":"2026-08-05T10:59:05.185580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.976866Z","title":"A convnet for the 2020s","venue":null,"work_id":"b36da0f3-24a2-4bcd-ad79-2a6726158485","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.190421Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:ec2b8f98eb0cb1a12088072313c7d71de32ebe2ef83e2de97b7b71de0b9a6cf1","observation_id":"25b9ce09-b7b6-4c85-9f2a-646781b75f3b","resolution":{"observed_at":"2026-08-05T10:59:05.981270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.961903Z","title":"Downs, Preey Shah, Tri Dao, Stephen A","venue":null,"work_id":"f83c3950-9c8a-4a1d-8153-438cb31f9bb6","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.195376Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:78e85e11c98c50855a565efa901bd21933c2f76e7c98f1c0174a1d196d65df28","observation_id":"32d52451-a406-4fe0-b256-332c2401d76f","resolution":{"observed_at":"2026-08-05T10:59:05.966685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07711","last_updated":"2026-06-27T16:03:47Z","snapshot_observed_at":"2026-08-17T01:35:09.763246Z","submitted_at":"2024-03-12T14:53:56Z","title":"SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07711","snapshot_observed_at":"2026-08-05T10:59:05.201010Z","title":"Ssm meets video diffusion models: Efficient long-term video generation with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.201010Z"},"links":{"cited_paper":"/paper/2403.07711","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:a7f22fca65662133fea0e8c56a2fa214826e4b865627f24ff915d53a0377fc0e","observation_id":"27d19b19-9f62-493a-8a90-c85f26493ea3","resolution":{"observed_at":"2026-08-05T10:59:05.201010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08476","last_updated":"2024-07-11T13:11:21Z","snapshot_observed_at":"2026-08-17T23:58:20.568677Z","submitted_at":"2024-07-11T13:11:21Z","title":"VideoMamba: Spatio-Temporal Selective State Space Model","version":1},"cited_work":{"arxiv_id":"2407.08476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08476","snapshot_observed_at":"2026-08-05T10:59:05.419081Z","title":"VideoMamba: Spatio-Temporal Selective State Space Model","venue":"cs.CV","work_id":"075daf15-2345-4ba0-8518-ae2b1bfbabf6","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.206923Z"},"links":{"cited_paper":"/paper/2407.08476","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:46d67a9e2cf09dbf4cdb3a6b15386837e8742bf9e5f60d2389c81c475ae6c368","observation_id":"aa2611a9-9b26-4ddb-8bc8-7cab31ca8ec6","resolution":{"observed_at":"2026-08-05T10:59:05.426653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.946682Z","title":"Rethinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"cc6043b6-b237-4002-9778-21fc4128cf5d","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.213214Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:fd2820f55194cbf6b56265c54cdddaf0dfb058bf622533fffab3c798420b2beb","observation_id":"d1096f00-3e6c-4016-b9ab-16b2e3d017ec","resolution":{"observed_at":"2026-08-05T10:59:05.951879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.931197Z","title":"Dynamic pretraining of vision-language models","venue":null,"work_id":"eb1916ae-d911-4816-9dcc-e32e5254259b","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.218342Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:2315a8063fcdb2adea4961253fd08a2ec4c78cdbc05732ea11d3225441d908b3","observation_id":"6666fc41-e35c-43e4-a9e6-225d4f339952","resolution":{"observed_at":"2026-08-05T10:59:05.936144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.914892Z","title":"Mirasol3B: A multimodal autoregressive model for time-aligned and con- textual modalities","venue":null,"work_id":"ebb7374b-20ad-4cd4-a458-9ae73c61883e","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.224715Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:044a7e39cf9def3476f556f41eed4523eb17346aa8f4b4da1b0387d12e17f506","observation_id":"c7bfcf73-dd47-4dc2-a241-e88a69dfca1b","resolution":{"observed_at":"2026-08-05T10:59:05.920264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.898648Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"929ff5ec-ad6d-4465-910e-c89b5e7016cd","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.230302Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:cf5b23f6e9f0b5e7e87e91c9324fce935849ae5d0aaf404e40a323965727c521","observation_id":"05b6e8c7-1d46-4af4-81c0-2c282d6d95d4","resolution":{"observed_at":"2026-08-05T10:59:05.903696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.883314Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"26c17508-2d74-4077-a662-047cd3fdf3ea","year":2017},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.235876Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:a7527af548d9db72abe92017dfea590696a11b66bb894714ff388ba5d8ce75b6","observation_id":"b33834a9-be83-4272-b023-ffe06f022bb8","resolution":{"observed_at":"2026-08-05T10:59:05.888158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.867960Z","title":"Cider: Consensus- based image description evaluation","venue":null,"work_id":"c7a22a3d-1600-4ba2-9254-0c4e36778516","year":2015},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.241325Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:873ea1acd7eb3306ffa676ad13ca17fb4fa507cbb3206fe65930ed5573a4fe61","observation_id":"fdcfeb93-88ae-4938-86a0-319a6302e0b0","resolution":{"observed_at":"2026-08-05T10:59:05.873713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-20T03:47:10.217701Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-05T10:59:05.246519Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.246519Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:616e1c6048f92a80c461a9e06ef48ccc0742204e00e229be99f38440cb0ba17b","observation_id":"dfae2cd1-8124-40fb-8e84-203c0db2fe08","resolution":{"observed_at":"2026-08-05T10:59:05.246519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.851099Z","title":"Bidirectional attentive fusion with context gating for dense video captioning","venue":null,"work_id":"690a4e55-ae7c-40ff-a491-b8b1b4225d2e","year":2018},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.251579Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:b1555e37d672eef314e0c7904f0928b892eefcbc1f06f3edac7ce832f55d3790","observation_id":"89ad7e88-ac55-45b2-b712-7ea2327f3ac8","resolution":{"observed_at":"2026-08-05T10:59:05.857024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.834732Z","title":"Selective structured state-spaces for long-form video understanding","venue":null,"work_id":"113b61ee-36e0-4b0d-bb25-6b84fc8cac55","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.256934Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:4464b43e1abc3f19477050a9fab9df506b791f1553c2d4355b352542e0d26aad","observation_id":"b004eba0-e72e-4671-a7d2-ea3858afc324","resolution":{"observed_at":"2026-08-05T10:59:05.840726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.817435Z","title":"Omnivid: A generative framework for universal video understanding","venue":null,"work_id":"d2b41741-2b81-4206-bdea-175dd136f92c","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.261979Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:dc652c03125b9f0311c06ae44cae1106dcadf0aa0435b0fef5550523a96fd094","observation_id":"79fc654f-ca8e-4874-b01e-f665e61a48b2","resolution":{"observed_at":"2026-08-05T10:59:05.823966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.802490Z","title":"End- to-end dense video captioning with parallel decoding","venue":null,"work_id":"8ae6f3d2-3adb-4cbe-a373-0ddd67d81b87","year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.266645Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:d57e4ea4d038fc3d3c36ba42945938dd390fd07efd264eb5bed098c5092cd5b3","observation_id":"0c3f3c76-adad-4ea5-945d-c3afc4e5e9d4","resolution":{"observed_at":"2026-08-05T10:59:05.807389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08819","last_updated":"2025-03-05T23:00:57Z","snapshot_observed_at":"2026-08-16T14:01:18.649299Z","submitted_at":"2024-04-12T21:30:06Z","title":"The Illusion of State in State-Space Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08819","snapshot_observed_at":"2026-08-05T10:59:05.271932Z","title":"The illusion of state in state-space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.271932Z"},"links":{"cited_paper":"/paper/2404.08819","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:8c275738149cdd1133053b7bbc1c97ccaf81e108062c74ca78aa228cfffef870","observation_id":"0742e15a-10e6-476a-8cf5-6b6c38583dd5","resolution":{"observed_at":"2026-08-05T10:59:05.271932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.786639Z","title":"Dibs: Enhancing dense video captioning with unlabeled videos via pseudo boundary enrichment and online refinement","venue":null,"work_id":"76d93a21-4310-4975-a56f-a75d4b2bd48c","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.276722Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:3481cb074a8176361b0c74fb2a33b65be01cfb74e942bab12752e23d51010849","observation_id":"ab7d1216-38f4-44f8-bfac-296252236029","resolution":{"observed_at":"2026-08-05T10:59:05.791726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.770444Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":"1e4efb4e-4ec8-4b83-a241-0aa29e01319d","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.281749Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:84f73f4676aa35d4ae5d7be264d66b084341fc1ecf88ff5befd5ac3e63453552","observation_id":"66b8ffce-91e3-4b18-9aec-5375f4ffe0c6","resolution":{"observed_at":"2026-08-05T10:59:05.775654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.753863Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"c56e3e83-813b-4f5e-8c4f-35ee9f96139a","year":2023},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.286212Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:cca0362ffbdd993ed017deea38fcd0c01b5cbb93726317d557159a9f34665990","observation_id":"095ad276-acb1-4764-8beb-0644dc2bde8a","resolution":{"observed_at":"2026-08-05T10:59:05.759187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.737020Z","title":"Merlot: Multimodal neural script knowledge models","venue":null,"work_id":"3f50a820-0dd7-41f1-9bb2-05571dd05b88","year":2021},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.291033Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:456078cdf7a62ef5f9864da54a608b6f44f493e465a9033f892d9fa077447a85","observation_id":"e3b22238-bb17-499a-a7e7-883e5526a1ad","resolution":{"observed_at":"2026-08-05T10:59:05.743057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.718745Z","title":"Unifying event detection and captioning as sequence generation via pre-training","venue":null,"work_id":"a0966793-1616-402d-b13d-f8a8cec0ccc9","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.295700Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:7cef84eb138afd1aa950770661d3d1b2f544daa3cacc4793adc85193ad866c28","observation_id":"cce30a80-326c-41e7-8b40-7bd4addec768","resolution":{"observed_at":"2026-08-05T10:59:05.724265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.701271Z","title":"Towards automatic learning of pro- cedures from web instructional videos","venue":null,"work_id":"6b29e722-8c2b-4096-be8c-fe6407d116e1","year":2018},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.300370Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:d25aad5b212900bce7b883749f3374ea609e3200bdbb1a2ee9db9a72d079f04d","observation_id":"010fbf44-0d72-4c54-81d8-e80060f91912","resolution":{"observed_at":"2026-08-05T10:59:05.705813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.684921Z","title":"End- to-end dense video captioning with masked transformer","venue":null,"work_id":"c00618b2-b1bc-4693-a15b-3f7182fb15db","year":2018},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.305534Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:7c524185369b899de66c34af313adb81ddefa9f48ba23f9585b384dda64c0607","observation_id":"34ea5893-63ca-41e8-be67-a2fdbafbdcd3","resolution":{"observed_at":"2026-08-05T10:59:05.690821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.667714Z","title":"Streaming dense video captioning","venue":null,"work_id":"d344baef-688a-4b2e-97ac-c096c4350e5d","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.310438Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:cf3a0e86fbc060680eb2aa9608aec57f8bd506cd8304459c130a8292301a6eb2","observation_id":"fcecb641-1158-4264-bf34-bea5569e83bb","resolution":{"observed_at":"2026-08-05T10:59:05.673618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-08-14T11:12:31.002605Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-05T10:59:05.316796Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.316796Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:8d9539db1c6af9ec25516d179884409ace1fe6e249b9bb2dcc2f433bd1fe006a","observation_id":"7dee1653-5de3-427f-884a-53f77c052c4e","resolution":{"observed_at":"2026-08-05T10:59:05.316796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.650290Z","title":"Thapliyal, William Yang Wang, and Radu Soricut","venue":null,"work_id":"82f014b5-3dfe-49ac-94bd-7eca6792797c","year":2022},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.322511Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:3bc9605f2f7dc23a4d3782186260f376ace7ba56d6d7743a720522017dad07f6","observation_id":"ebbb1fd9-7e14-4c77-a4ae-e0ad3e36a2bd","resolution":{"observed_at":"2026-08-05T10:59:05.655316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:59:05.632370Z","title":"State space models for event cameras","venue":null,"work_id":"17d0d7d2-d910-40e0-8d45-2a7b158cd85f","year":2024},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.327148Z"},"links":{"citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:934e869d07d17d36d2dfa3d84590acf884ed6de04354390b16617cbbf7e7012a","observation_id":"f97a4890-fbba-44b6-b68c-42ff01c071f5","resolution":{"observed_at":"2026-08-05T10:59:05.637715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T10:59:05.052003Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T10:59:05.052003Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2509.03426"},"observation_digest":"sha256:ddd97610c9ce7b3d55a92646923b739e2cf61e7dd0a0eef88c4b852d716db524","observation_id":"97c46b42-392a-4835-a400-0d62648a5eae","resolution":{"observed_at":"2026-08-05T10:59:05.052003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03426","last_updated":"2025-09-03T15:56:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T05:29:46.250084Z","submitted_at":"2025-09-03T15:56:20Z","title":"Time-Scaling State-Space Models for Dense Video Captioning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2509.03426."}