{"as_of":"2026-08-04T20:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0ec742d4ae6aa47b43d9c317b8a28cc4dbcd2406dc299bfb947ae5961a113a2","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T12:01:02.997589Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.03919/citation-record","integrity":"/paper/2604.03919/integrity","json":"/paper/2604.03919/citation-record.json","paper":"/paper/2604.03919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:c7aaf93d506598014963358ad262d43f2a541ee5b76f591eddbefa77d3bec9ab","observation_id":"d280a2e6-894a-4d2c-be0b-c14343a7af07","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:ec850305c56a5d743cfb19275f906b7e622781296eb3feb72f35f95ef3df21de","observation_id":"0717ce59-2fbc-408d-826d-fa861af72f8e","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06410","last_updated":"2024-12-09T11:39:00Z","snapshot_observed_at":"2026-08-01T21:49:25.316353Z","submitted_at":"2024-12-09T11:39:00Z","title":"BatchTopK Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06410","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2412.06410","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:6ba3c0da97e888c434ee6f439ea822d04200bdac749d1fc754671ae3ca2e71be","observation_id":"7b0861a5-8004-419a-84ed-ea0b201911b9","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:2c43f7ee0b5976adf92f583254c6619fb8b5ad6423a14f4321be4250ce04a107","observation_id":"a74b171e-2ed0-48bc-81f5-983d5823f2fb","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":"arXiv:2309.08600 [cs.LG] https://arxiv.org/abs/2309.08600","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:fcc413fbb9a2f593158d6ab9422246678f96b1c1771454f089337d5da5f5935d","observation_id":"bd90e026-701d-4738-b113-791fbf3d894f","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.103406","doi":"10.1016/j.cviu.2022.103406","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:15:01.900215Z","title":null,"venue":null,"work_id":"a463450a-2ab3-45cb-bb7a-4807c93fd8b6","year":2022},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:e2003e1b2a86ea8cd92c42f20cb695f3a3810a1f0aeb13b4e41460175be6c60c","observation_id":"763d40df-1cf3-4378-a6ec-20a869df75ca","resolution":{"observed_at":"2026-07-13T12:09:35.531886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:d3c2be303d0c97123cde43ebbe569e6808d4e02874cd8bf053eb80fb9584d9b0","observation_id":"f63a962c-1029-44d8-8605-c30e082eb22c","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04261","last_updated":"2017-06-15T21:15:13Z","snapshot_observed_at":"2026-07-06T05:46:43.820045Z","submitted_at":"2017-06-13T21:26:19Z","title":"The \"something something\" video database for learning and evaluating visual common sense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04261","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/1706.04261","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:0523f403394b6f66504cb449b4e21f56eebe4d7238a1d51b7d87b3ae6476f4ee","observation_id":"994d8252-2e83-4c78-809d-7b71f84a16e5","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00328","last_updated":"2025-08-30T03:01:57Z","snapshot_observed_at":"2026-07-31T20:16:08.700320Z","submitted_at":"2025-08-30T03:01:57Z","title":"Mechanistic interpretability for steering vision-language-action models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00328","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2509.00328","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:544a978eaf54a85c3d7da0c25d7cad9b62b5d6b230cb878f40fe68dde9d2d9c2","observation_id":"9a224e0d-5c59-48c7-86dc-70addb5af670","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08729","last_updated":"2025-04-11T17:56:09Z","snapshot_observed_at":"2026-07-06T21:08:01.403325Z","submitted_at":"2025-04-11T17:56:09Z","title":"Steering CLIP's vision transformer with sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08729","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2504.08729","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:957a4a1ceb0e55fffd693dd0e14ef2391ced0b0de6e08256a10a590cb8301bbc","observation_id":"b4355137-defe-4ecc-9bf3-16a0739fbb7e","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:31bb87968b1ca8f4db93b932fe0b79621fce05b27de76a4035d094db15cf96e4","observation_id":"ed65cc81-a023-4163-850d-ab7814252275","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":"Anwar, and Manzoor A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:9760f5a60ac0c64934097f2b240295ee3945dc4eb712c675890487a625621770","observation_id":"c81d3e90-2b98-477a-ba9f-b8f7d4ee5b20","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":"InMechanistic Interpretability Workshop at NeurIPS 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:2d16398975848840f46239d3bd54572a9781c7df8cb054e6cbf7bed5900d983d","observation_id":"a48979d6-f51a-4c45-a44c-d1053f86a272","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:34fef9ce95fbc1dfc1f0095ed5347df0748289cdb489bfaea92642ed398b8fbb","observation_id":"416f27a4-a02a-4eb7-85fe-7d38b18ba032","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:e6ac536d67aa64314dd76e2515059811c757b46a49429dc3b2b71bcd0a8e1326","observation_id":"689e70e7-2ddf-4d43-a15d-8e35fe7a6822","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:c553d4bfea7fbfaf82a4fb4b15259f63e1a3dab6d5e662180aee24d9d1f13c51","observation_id":"847ef516-85e4-4054-8d8f-ce401133de67","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:43f7efe0d6bff71bbffa1962ca57ecdf2bb19a9b9bb1c4db248af57984a7b7b3","observation_id":"6186501e-3046-409c-964d-a05f1c8a5542","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:1eb55e508e4e123740a952accecb4fb5f239a7cb679902077550aab87f49c207","observation_id":"ee29588d-131e-463f-a010-ebb95aa18f57","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:fac26d67b9ff7d2f1be6c13d513a1adeae0a6c240e771ba0362ed234ef157de5","observation_id":"2331d670-77a6-47b5-9b75-82dd1a6a3543","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14435","last_updated":"2024-08-01T17:42:04Z","snapshot_observed_at":"2026-07-06T18:49:06.836479Z","submitted_at":"2024-07-19T16:07:19Z","title":"Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14435","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2407.14435","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:b8e855052ed7434b12457d4ed9cb90ccc2211e42f585e82557461be850e5a578","observation_id":"c3294692-5b20-4f7c-96b4-2622d3a64e90","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:61bf496ba2b42f983cf078f5ace144672a9473171117a42a646c98b16c11123b","observation_id":"90a1949a-ff3e-467e-aed1-07eda143c752","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12039","last_updated":"2020-08-25T15:49:48Z","snapshot_observed_at":"2026-07-06T09:07:36.895964Z","submitted_at":"2020-03-26T17:12:42Z","title":"RAFT: Recurrent All-Pairs Field Transforms for Optical Flow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12039","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2003.12039","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:3dbd1f8aea5b2da1241dc3a667187da94aebd1361b65d8b4a0f8150c86f58e39","observation_id":"079297de-ee13-462d-820d-68c9d5e5139a","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:54a6fcb235a47c581baa7caa34bcd5da813839bc2fa2c718736153a58b39d679","observation_id":"d5c93816-aaf2-4008-9ab9-957d9d8b530f","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:cc3a779bb0aa09bb6eff03d750bd5755d93d444291f05fa0d6f526d864baebf6","observation_id":"a91e62cd-f7f9-41d5-8f25-666a78105900","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-03T12:18:50.799898Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:d4cd9e8798ee35b449c8e6fee96604d4e35e004b1cfdf20ca38c6749e35916c4","observation_id":"097ec171-d4f5-48ea-8624-e42e5edbdbd3","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:a599ff715935fd92d60cd5b615438deb50902221f62f7b6f965333196ba6120a","observation_id":"36df1305-5592-4a67-919d-2b483ae9f7fe","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00630","last_updated":"2024-11-01T14:40:07Z","snapshot_observed_at":"2026-07-06T19:43:37.792643Z","submitted_at":"2024-11-01T14:40:07Z","title":"STAA: Spatio-Temporal Attention Attribution for Real-Time Interpreting Transformer-based Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00630","snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"cited_paper":"/paper/2411.00630","citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:74de1e228193c3c4451ea8816faa9f0089173c3db9362aac5ceae7adfb574775","observation_id":"3d79df1c-4921-4f42-8470-c46817602c7c","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:d16ba9416e0fd61e45d147e9f7fc7bb98758bfb8e923b26ffd12ba903274420a","observation_id":"967da691-e205-487a-bc84-2ca367fa5fe7","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T12:01:02.997589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T12:01:02.997589Z"},"links":{"citing_paper":"/paper/2604.03919"},"observation_digest":"sha256:5787574a798d58600879e6270aff8945ab6b5091c018e46a98a247bb951ee083","observation_id":"c4c4a8f9-705f-4575-9ff3-3876af76bf02","resolution":{"observed_at":"2026-07-13T12:01:02.997589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.03919","last_updated":"2026-04-05T01:08:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T21:51:09.826716Z","submitted_at":"2026-04-05T01:08:19Z","title":"Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2604.03919."}