{"as_of":"2026-08-21T14:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec3ffc589d70324dffb85fc0687399a7bb006a68d4201454844e1106688ad441","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:32:32.779525Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17625/citation-record","integrity":"/paper/2607.17625/integrity","json":"/paper/2607.17625/citation-record.json","paper":"/paper/2607.17625"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:31.805352Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.805352Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:c6347ee153ade2046519699347cd1c87f2fa662c06e8a0c6a5457b3dd8c2a629","observation_id":"b2934132-5f1d-4eae-9e35-d094583dca69","resolution":{"observed_at":"2026-08-01T17:32:31.805352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:32.025369Z","title":"Kriegeskorte,N.,Mur,M.,Bandettini,P.A.,2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.025369Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:f6fa9d28a4e93565656df1c239e7b92817f963b67fba97ab9faa986cd5069f5b","observation_id":"5183664c-3937-4b08-9129-bb10746a9658","resolution":{"observed_at":"2026-08-01T17:32:32.025369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:32.109686Z","title":"7083–7093","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.109686Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:55a14ed7a61e64b730eece4d65a98995f321c0ec581dd9a33d6361803f4e12e7","observation_id":"9f1418dd-b901-46ca-b735-c3890d6709fe","resolution":{"observed_at":"2026-08-01T17:32:32.109686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:32.452451Z","title":"Simonyan,K.,Zisserman,A.,2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.452451Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:1815b512c96d190cee5400deafff93aee48155b28e76b264d9fa3f4f4fefb7c8","observation_id":"8fb46a7a-9821-46bf-992a-e5190ef66cba","resolution":{"observed_at":"2026-08-01T17:32:32.452451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:32.572224Z","title":"bioRxiv , 2024–08","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.572224Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:1735e2ed8ea57d0887309dd2a0dfae057c3b2b280a208adc944b316b4b08c5cb","observation_id":"f542c439-69eb-49c1-9461-4389b095a555","resolution":{"observed_at":"2026-08-01T17:32:32.572224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-01T17:32:32.684550Z","title":"arXiv preprint arXiv:2006.04768","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.684550Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:ef8d011903b2934b6282efe0c9d87029c0e28d754e457f71cbe9a7fdcde3433e","observation_id":"4d1d83f3-c48c-40c7-9ddf-df6a5e05a41b","resolution":{"observed_at":"2026-08-01T17:32:32.684550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:32.779525Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.779525Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:bdb734984b2fa6bbd1854a30eba06ed5baea924fdd240a2cc9ce6194703bb85e","observation_id":"a520108a-22a8-4d88-b049-56c4ef6e8829","resolution":{"observed_at":"2026-08-01T17:32:32.779525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:31.663196Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.663196Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:f65e066f5108c751de0825f395382aa65ec7ad2e46e28b9a5df3a8f1295a073d","observation_id":"f1535035-cb7e-4753-900c-0874cc603f60","resolution":{"observed_at":"2026-08-01T17:32:31.663196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:31.920926Z","title":"Kietzmann,T.C.,Spoerer,C.J.,Sörensen,L.K.,Cichy,R.M.,Hauk,O.,Kriegeskorte,N.,2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.920926Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:a4b20bc6b619e5d06b802e8821cc393b7f96f68d0e0c79604c4e32322e7da711","observation_id":"1821b493-04e7-4b07-aad5-5bdfe5e1318f","resolution":{"observed_at":"2026-08-01T17:32:31.920926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-01T17:32:31.390171Z","title":"arXiv preprint arXiv:1904.10509","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.390171Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:fe4413643a71ac81a616758fb09cec0db69cf64e68e6a17fd0b63967f897a02d","observation_id":"1a547d22-545c-43d0-919a-1126842528ee","resolution":{"observed_at":"2026-08-01T17:32:31.390171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T17:32:31.269043Z","title":"arXiv preprint arXiv:2004.05150","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.269043Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:b3299ecf62510c18233e96af6806d9cee9ea4d4f2de718f336672fac4db020ba","observation_id":"a5d50fbb-5895-4c44-a5d9-f5bd89fea0ad","resolution":{"observed_at":"2026-08-01T17:32:31.269043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-08-19T12:45:01.260502Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-01T17:32:32.351486Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.351486Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:61ccfc1c66a509fa8915e690d6cefe289272a217d138b6e85bd5c273bc5ba0a6","observation_id":"4d53f9a7-1533-4aa6-8abd-329d56327106","resolution":{"observed_at":"2026-08-01T17:32:32.351486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:32:31.539488Z","title":"biorxiv 2022.07","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.539488Z"},"links":{"citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:e482c2bcbffb08deba7a52bb8af9d770d011e5bdb43695e41b15149687a294f0","observation_id":"a40c26b4-5cb3-405a-9ece-db650f015bfe","resolution":{"observed_at":"2026-08-01T17:32:31.539488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16128","last_updated":"2024-03-24T12:55:50Z","snapshot_observed_at":"2026-08-20T13:54:49.061738Z","submitted_at":"2024-03-24T12:55:50Z","title":"Enhancing Video Transformers for Action Understanding with VLM-aided Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16128","snapshot_observed_at":"2026-08-01T17:32:32.229775Z","title":"arXiv preprint arXiv:2403.16128","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:32.229775Z"},"links":{"cited_paper":"/paper/2403.16128","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:160f94dfd4caa202392a94c3662e284836d30bd1ebfb520a58cac39b7dfe01a3","observation_id":"76cbf30b-ec71-491e-884d-c9542975eeca","resolution":{"observed_at":"2026-08-01T17:32:32.229775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-01T17:32:31.208111Z","title":"arXiv preprint arXiv:2506.09985","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:31.208111Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.17625"},"observation_digest":"sha256:5b4274fd445820c3080211b4f2c3193d4093906adfb43563c8290cb257a34fee","observation_id":"5a1c39fa-ac90-491d-8a08-138f889d4e4c","resolution":{"observed_at":"2026-08-01T17:32:31.208111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17625","last_updated":"2026-07-20T07:30:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T15:48:40.681779Z","submitted_at":"2026-07-20T07:30:16Z","title":"Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2607.17625."}