{"as_of":"2026-08-12T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:218e67b9b927929e707a937c0ab9026ac0293e3795df8ab26203b515d8370ee7","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:17:37.530726Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00367/citation-record","integrity":"/paper/2508.00367/integrity","json":"/paper/2508.00367/citation-record.json","paper":"/paper/2508.00367"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.14740","last_updated":"2025-02-20T17:08:43Z","snapshot_observed_at":"2026-08-07T18:01:23.936409Z","submitted_at":"2025-02-20T17:08:43Z","title":"YOLOv12: A Breakdown of the Key Architectural Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14740","snapshot_observed_at":"2026-08-06T10:17:37.245074Z","title":"Yolov12: A breakdown of the key architectural features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.245074Z"},"links":{"cited_paper":"/paper/2502.14740","citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:8fa3bbd320ed5ab423b0e933d8a2f8c53d9ae63956d903de577b5868833ad77b","observation_id":"439c23fc-3dbb-4a25-a11d-eceb4e8a3090","resolution":{"observed_at":"2026-08-06T10:17:37.245074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.357628Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"19a4d221-306e-4f55-8313-d19555e62f0b","year":2017},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.249438Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:2fcddb5d71973e2be1ce85d34e6ca46d216ec79a31f2cf8844c18c3da55a959f","observation_id":"834dd77f-01cf-45bb-a053-f8f32f8621d5","resolution":{"observed_at":"2026-08-06T10:17:38.361408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T10:17:37.253178Z","title":"Long- former: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.253178Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:633730fb3697dfc3e5a6812eacb3d1d021b6c77a91f030321f1ed1d634196dbe","observation_id":"3ec508eb-8bdc-4d7a-ae96-85375a974b81","resolution":{"observed_at":"2026-08-06T10:17:37.253178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.346321Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"02628303-7096-487d-aee0-5d781a68b64d","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.257345Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e15bfddcb3d51557ac96be4378127fbd30515092c9368d97e4d5c7f3eb045174","observation_id":"b6b8a5b0-ad36-4e4f-84fe-9b7957fda267","resolution":{"observed_at":"2026-08-06T10:17:38.350081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.336206Z","title":"The pagerank citation ranking: bringing order to the web","venue":null,"work_id":"7669e673-765b-4002-84a6-c4bf8f699519","year":1998},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.261153Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:fc0a9522eb47badb69859621226986380f04b1912d81774ecc0e3b74d3860d02","observation_id":"d71c1e61-43be-498a-8385-10f5198ec7ac","resolution":{"observed_at":"2026-08-06T10:17:38.339846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.265113Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.265113Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:2248b598f610ef3387dbb8a5e00035e80714ba885f0e7372f608f0e5fb03b42a","observation_id":"ef29e2ca-4c00-44d3-a60a-1d7d4d7e708d","resolution":{"observed_at":"2026-08-06T10:17:37.265113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.319646Z","title":"Efficientvit: Multi-scale linear attention for high-resolution dense prediction","venue":null,"work_id":"55785100-6b23-4670-a43a-4b04797846e7","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.268997Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:3583a2da525f6c14375c85bb703fe5287c1e0b20338f59ca01b3b7143d096f3c","observation_id":"fd7f42dc-690b-4017-a3db-a9946bc38b03","resolution":{"observed_at":"2026-08-06T10:17:38.322907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.309406Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"72ba7218-f3b1-4432-9475-c3521c84e390","year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.273080Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:c774ac9ccd148836064c689ee07f297b28537e35b23660fab449f618fd8b8ee4","observation_id":"6c14ae1c-b32f-4002-991d-0488a4d80e32","resolution":{"observed_at":"2026-08-06T10:17:38.313086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.297768Z","title":"Scatterbrain: Unifying sparse and low- rank attention","venue":null,"work_id":"ce2b5a0c-6c51-49e2-9389-9e8f1bf61d83","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.276648Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:fc5c6a5f67c1006622aa07d8e95abe4777bcd958f0691c7e31eb8040c151f2c9","observation_id":"53992252-77ed-4b3f-91d1-ab9d594450e3","resolution":{"observed_at":"2026-08-06T10:17:38.301342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.286434Z","title":"Collecting highly paral- lel data for paraphrase evaluation","venue":null,"work_id":"05dcda92-14a5-4fd0-9ced-943decfd1b97","year":2011},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.281173Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:f9281b910834a7bbfe3c598f814f6192b1afcaf47d48930bc37cda75ef8b15c3","observation_id":"6a20e93a-f9c6-4122-97ed-1ed47dc84aed","resolution":{"observed_at":"2026-08-06T10:17:38.290088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.284773Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.284773Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:de9bbbe405eaf2cec2d49704564d627b1c2809bf0c99763408f6bacdcfd96e4c","observation_id":"c9c62137-8e67-454a-bed1-7b33d7b70be7","resolution":{"observed_at":"2026-08-06T10:17:37.284773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.268439Z","title":"Per- pixel classification is not all you need for semantic segmen- tation","venue":null,"work_id":"213e1f6a-778c-4102-8f54-61507d302730","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.288824Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:8078bb9e22e20e03729c52002a248cff13ebe59cda764db3905009895f534b52","observation_id":"cd7c67bd-1b26-4bd3-bc68-b71bc84b7609","resolution":{"observed_at":"2026-08-06T10:17:38.272606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.257560Z","title":"vid-tldr: Training free token merging for light-weight video transformer","venue":null,"work_id":"05fb75c4-cfcd-41e9-99f1-31682ee3208a","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.292441Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e5e084f7b43924ee2520d91f7a59eee55ccada6958677aadef5de043c1b27e28","observation_id":"72b7429e-05d0-4f95-8cbe-937d1f088199","resolution":{"observed_at":"2026-08-06T10:17:38.261904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.245657Z","title":"Rethinking attention with performers","venue":null,"work_id":"4a148a95-244b-498f-b8b5-0fc6ee48c058","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.296225Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:4d876952c5f6501df36b24a8cc51f5fe5fa72d20dfb57a4eafb69d94daac25d4","observation_id":"52ec060b-295d-4675-9254-d4824dd7a5bb","resolution":{"observed_at":"2026-08-06T10:17:38.249905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.234402Z","title":"Twins: Revisiting the design of spatial attention in vision transformers","venue":null,"work_id":"df8502a4-b7c7-44d3-b5e7-3a69bd19566b","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.299824Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:64c5fdf85f97f53d11492d64dd991860a25c3170884968597b5e59771018c882","observation_id":"c3bf9b5d-c127-4756-80b5-410576ab1ec5","resolution":{"observed_at":"2026-08-06T10:17:38.238321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.223571Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"68323353-eef3-4e51-8482-60e8e51549ce","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.303241Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:10c074984d0efe0408d9b5a0460315b12a3eec916f14fc230ed5f95cc48ffa19","observation_id":"47e4e8e5-864b-4cfc-ae71-35caf81aaab2","resolution":{"observed_at":"2026-08-06T10:17:38.227105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.213353Z","title":"Vision transformers need registers.ICLR, 2024","venue":null,"work_id":"d55a73f1-12a7-4278-b1df-910a624460c3","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.306625Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:440c1bc59682829ce727b5667a4765e0fe4e3bf9e220a28100146921ff158bf4","observation_id":"f3170c15-5aba-4db6-8e51-74fed2f4fcc4","resolution":{"observed_at":"2026-08-06T10:17:38.217026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.202945Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"f467ec49-d2e5-4e9a-ac71-8b7e98371cfd","year":2009},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.310053Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:cb93043d3743d0f7bb6a1b70ed3349f82e3b60e17123c1baecafc05468194841","observation_id":"37e4a5f1-6439-4177-9fad-9c1e44f7333f","resolution":{"observed_at":"2026-08-06T10:17:38.206538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.192559Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"f74da699-9c01-43cd-b0c3-32838fc2ebde","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.313602Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:5e2cf0bcc271ed768eaea6e294fbfa7f0a80c57eca499853eacb0425c50758d8","observation_id":"3fd7ee43-b197-4d65-aa39-6838b1efe460","resolution":{"observed_at":"2026-08-06T10:17:38.196215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.181777Z","title":"Levit: a vision transformer in convnet’s clothing for faster inference","venue":null,"work_id":"5e94daff-8815-4b3a-b1c3-0df86cefe364","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.317128Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:d13f73d363e77fb15c4f31e1cbe33f967a80f2d254cd8368f5579cd7a2ab23da","observation_id":"701bdeec-1175-45bd-802a-7a638a61ac94","resolution":{"observed_at":"2026-08-06T10:17:38.185798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.320934Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.320934Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:34808d91305fadf5261b5dc3db013a51cf6e78a597cc6a6a5b5871156377a2fb","observation_id":"ccf354fd-0ee4-4941-8378-b8153f17d1cf","resolution":{"observed_at":"2026-08-06T10:17:37.320934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.166142Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"342d59b6-5c0e-4a23-a04b-0052ecc176c8","year":2020},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.324633Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:f89ab39ba31e7fe1ba167f56c7f35dce214d8ac5f4695c13258b940158600f1f","observation_id":"75ed4c45-173c-41f7-9ff2-6d00c2940bd5","resolution":{"observed_at":"2026-08-06T10:17:38.169566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.156499Z","title":"Groupwise query special- ization and quality-aware multi-assignment for transformer- based visual relationship detection","venue":null,"work_id":"ff828b2e-eca8-4973-a404-ab4ff24dcf80","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.328260Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e1455c6d8926bdbf2636e1f08b191581112f8f1cab4a99d421ff779d2919587d","observation_id":"eeb2938d-1e8d-4039-b27e-6fe95e51e6ea","resolution":{"observed_at":"2026-08-06T10:17:38.159999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.146717Z","title":"Learned token pruning for transformers","venue":null,"work_id":"84473629-47f9-47fd-bb19-e5b3c2f11836","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.331879Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:433f6a30fc1d9485cf97890c695f7e98d8b825d9465d1551b33773d4d95fff51","observation_id":"657f2b3a-b9d0-4357-9602-ffc2c363ff1c","resolution":{"observed_at":"2026-08-06T10:17:38.150594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.136932Z","title":"Re- former: The efficient transformer","venue":null,"work_id":"cbef236e-0169-4010-ac72-8146abdc90b3","year":2020},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.335463Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:6ef85c76dc09e76274bb9a7ba8ceffaab0a1064f14b52e704a773feeffdee5ef","observation_id":"ae01be54-10b8-49e1-9adf-3d4f8cd6f2cd","resolution":{"observed_at":"2026-08-06T10:17:38.140460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.126437Z","title":"Video-text representation learning via differentiable weak temporal alignment","venue":null,"work_id":"fe871187-d4dd-474e-bd17-64b2f7eed97f","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.339051Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:f29731a471c454021da97da55660356c57ee356c260185e8e1a944f9f76f410f","observation_id":"53472f30-1d89-42ba-b682-3f150e4df0e3","resolution":{"observed_at":"2026-08-06T10:17:38.129807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.116981Z","title":"Meltr: Meta loss transformer for learning to fine-tune video foun- dation models","venue":null,"work_id":"d7e1054d-83fb-409e-8df7-e003fba5f50c","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.342586Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:ce103fafea9fa9b1d6b3ad7b10b95b964cf8209f3025d2ad410a551203f977a8","observation_id":"bfde008a-917c-4bed-ba23-4b18754fafe0","resolution":{"observed_at":"2026-08-06T10:17:38.120412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.107384Z","title":"Vidchain: Chain-of-tasks with metric- based direct preference optimization for dense video caption- ing","venue":null,"work_id":"f7cc0486-0244-47ce-beeb-bf24ff864ecc","year":2025},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.347191Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:9fc342afb55576b5b43b0a19be8b331df04b0f4dd75a9f7cb8fa407d5ba57948","observation_id":"b5be7327-bc2d-4442-b79a-7db7aa5ff005","resolution":{"observed_at":"2026-08-06T10:17:38.110961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.096796Z","title":"Multi-criteria token fusion with one-step-ahead attention for efficient vision transformers","venue":null,"work_id":"0648db53-ca4f-490c-a24e-bee73ef8b412","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.350707Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:6dfea136c8047b8b588857b6fb46a7d2a6de632ab113060e57c7196d43e88551","observation_id":"1d995e4e-7879-4f16-894e-71507675aa78","resolution":{"observed_at":"2026-08-06T10:17:38.101194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.087088Z","title":"Ef- ficientvim: Efficient vision mamba with hidden state mixer based state space duality","venue":null,"work_id":"dc476239-29da-4545-ae0b-055fbe6849c4","year":2025},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.354648Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e467cc8fa5fef3bc03d1e4081ec540f335ec819ff4a6585fb0a0074c1dce1ac6","observation_id":"219fafba-d79f-4abb-b72e-d25a5fffc2ac","resolution":{"observed_at":"2026-08-06T10:17:38.090855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.076093Z","title":"Revealing single frame bias for video-and-language learning","venue":null,"work_id":"5dbc1fc1-02a0-4cee-8f05-55f3b53dedf1","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.358360Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:ba8b8e4b0462b886f59a46547d9ef46416919417644336fe9d2c2364c4698a70","observation_id":"e4be632f-ca32-442f-9edb-6abe746f56cd","resolution":{"observed_at":"2026-08-06T10:17:38.080579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.064928Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"4de88c67-96e2-42bf-9606-5baf5b4d5158","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.361906Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:2f2a5d4c1a31154b729e44a5d94cec6ca7100dc9cb25f79418d27abbe479a970","observation_id":"6b884ec1-099f-4670-bdb7-8714a4bd78bd","resolution":{"observed_at":"2026-08-06T10:17:38.069455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.054798Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":"8257396b-a027-42a5-9ba4-122cb61c16b9","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.366025Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e719e4360020c0de19f73aab06b668aecb0709e01e0197d6d0fbf5fa99ba50a2","observation_id":"7d041539-a0a1-41e9-908f-677c73fb8b66","resolution":{"observed_at":"2026-08-06T10:17:38.058522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.043703Z","title":"Efficientvit: Memory efficient vision transformer with cascaded group attention","venue":null,"work_id":"712416f2-4446-4435-9b51-e5b5442b903c","year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.369484Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:75fe3f7272e6d0f9d7cdab61abfae27e566bdf0762176201d0afbbc67acb20bf","observation_id":"1327309f-33c9-42b3-8e6f-d24b9d1ad7f5","resolution":{"observed_at":"2026-08-06T10:17:38.048055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.033683Z","title":"Efficient training of visual trans- formers with small datasets","venue":null,"work_id":"57783ff2-df42-4bf2-b8ca-bfd62c2dc1b7","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.373219Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:8a7cad0373ac0ff386933c0a630b610f55c9f511763252d915495c9d9d953bad","observation_id":"9d727d43-1b07-482d-a29e-9cd6de3af726","resolution":{"observed_at":"2026-08-06T10:17:38.037298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.022847Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"7be91b5f-93fe-470c-8ac8-4039a3dc94b3","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.376978Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:93a113e90eb5c8ca1a37f0e5af6bb7a7252ff22ee23da40efe5623f66aa5a3f6","observation_id":"8b222a73-4d74-41c1-8cfc-7052ca63de35","resolution":{"observed_at":"2026-08-06T10:17:38.026751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.012379Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"8a637678-bffd-4f74-8f6e-fd1caffb757e","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.380759Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:99fec4cf121a3a9607801898959b6639e71f8f308e48d269cdd724fc91d2c802","observation_id":"c2e19a94-9d08-433b-ae81-c1bb19953063","resolution":{"observed_at":"2026-08-06T10:17:38.015920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:38.002412Z","title":"A convnet for the 2020s","venue":null,"work_id":"2fcc360d-9731-4248-b1db-ead57e22d3dc","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.385131Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:45675a2de6316059afa0fe1c2cea44e2a8af21f08b5fc4411c94c73bc3cae270","observation_id":"3d187d7a-25ae-4c0b-9d76-f557a3ecfba2","resolution":{"observed_at":"2026-08-06T10:17:38.005742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.991944Z","title":"Beyond attentive tokens: Incorporating to- ken importance and diversity for efficient vision transform- ers","venue":null,"work_id":"f650430a-0e4f-4565-9a7f-8c3bfb40f879","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.388648Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:214653935c9bf9c33a6b70daf9e82a9ed1b956f6d795740de7bc829836666368","observation_id":"638baeb2-fae5-4184-912c-17fc19bccc55","resolution":{"observed_at":"2026-08-06T10:17:37.995803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.980539Z","title":"Mobilevit: light- weight, general-purpose, and mobile-friendly vision trans- former","venue":null,"work_id":"7867a4a2-a781-4eef-ac1c-ce3a78f792d4","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.392171Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:0fd34529312e4e5a9051a6f67a01f342f600fe0fcae31bd79809e6c782cec382","observation_id":"2f42adb5-afef-4565-804d-1d8e0f251dc6","resolution":{"observed_at":"2026-08-06T10:17:37.984823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.969430Z","title":"Adavit: Adaptive vision transformers for efficient image recognition","venue":null,"work_id":"4e7bc76b-f257-4641-8cb6-d4390d153960","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.395751Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:179cad9b19fdbcb8506c4ebaccedddd44f0849520976ec0bfd231057f33abf42","observation_id":"306f7e7d-a44e-4f34-961c-19a37b616229","resolution":{"observed_at":"2026-08-06T10:17:37.973859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.399392Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.399392Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:8b01a844f449de7d78ecab92b40066aff7f74f6542fd1904fbe2951da6a8fd5f","observation_id":"1d9d0bd8-e400-472c-9f51-cdc0d3dca5ad","resolution":{"observed_at":"2026-08-06T10:17:37.399392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.953069Z","title":"IA-RED 2: Interpretability-aware redundancy reduction for vision trans- formers","venue":null,"work_id":"dd8897f9-b722-4d22-b0c1-959409b59835","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.402887Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:bf950b3ea6bb0c42440bbfe7a440bd8f076a98d1a94c9e65b912e234158d9145","observation_id":"45a042f0-a349-4328-a1d6-f72c95beeaed","resolution":{"observed_at":"2026-08-06T10:17:37.956492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.943099Z","title":"Deepvideo-r1: Video reinforcement fine-tuning via difficulty-aware regressive grpo","venue":null,"work_id":"8368aae5-d097-4cb7-9241-d6a496910520","year":2025},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.406688Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:441a749ff3cce45c5d59a5ebd4f4ac256fee69ddb956a1ab993dc6b7830e3c17","observation_id":"593486b1-4929-464e-a199-334f7b5c4ccb","resolution":{"observed_at":"2026-08-06T10:17:37.946986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.933060Z","title":"cosformer: Rethinking softmax in attention","venue":null,"work_id":"6fa522bd-b735-4e55-a179-d15f1f13dab1","year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.410218Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:6d88d8b1a94861e3a4a98cbc37196e0a3fc2e53b08ee09a9a4d1e0b02cf40a73","observation_id":"e0dbfeb3-8dfa-44b0-9c93-a4c0d37fd213","resolution":{"observed_at":"2026-08-06T10:17:37.936549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.923405Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"7229882a-66e9-464f-a386-b74dbfadbf1e","year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.414145Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:74015a13d4d2d5b2e6113a38379654bd10ed86842b6a5cca4159cbd625f1cfc0","observation_id":"6827bae3-dc9a-4ac4-b5c3-8b5817b23330","resolution":{"observed_at":"2026-08-06T10:17:37.927045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.913986Z","title":"Movie description","venue":null,"work_id":"30f89af2-3e05-4bed-a113-c2eaea1a77e1","year":2017},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.417659Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:8ec7ea07e73eecabc2a94b1879e5a0b0cd9b4a32bf49660655506a1b32a5dc8b","observation_id":"5e5f1771-e94a-49e8-8cd2-510bfb621389","resolution":{"observed_at":"2026-08-06T10:17:37.917121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.904797Z","title":"Efficient content-based sparse attention with rout- ing transformers","venue":null,"work_id":"36afe17d-bfca-4266-a662-f6c9ef3699b7","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.421216Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:252d1929db1a0761c329adcb2bf70cab885a1ad253c86ef38da9934b0a26c3b6","observation_id":"da2a2c77-7441-40e7-833f-df36dff6b2d6","resolution":{"observed_at":"2026-08-06T10:17:37.908118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.894843Z","title":"Segmenter: Transformer for semantic segmenta- tion","venue":null,"work_id":"d6603e0e-96b3-4a6e-bfb8-39016177b6e6","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.425323Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:717f69f8448c3a860c8012fa1b5b7d228cd64c09cd6e963a8f91162bbc729145","observation_id":"29202c4a-b6ac-419c-8f67-6c0f29dbac5f","resolution":{"observed_at":"2026-08-06T10:17:37.898403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.883589Z","title":"Removing rows and columns of tokens in vision transformer enables faster dense prediction without retraining","venue":null,"work_id":"3966af22-c66c-4736-bac8-5c934129879e","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.428847Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:1ebcd611822c48ebe147df099f04b3cc250c16633ca466124e2368bf8870f330","observation_id":"c7180283-0460-4236-84e7-851f202beea2","resolution":{"observed_at":"2026-08-06T10:17:37.888076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.872439Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"e653dc87-5c24-4c13-ba55-d3c82cd57ac3","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.432338Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e349c6da35f069131e8131ad6c525efdffd7eaba5e33980e22ec7142e90d0884","observation_id":"133854c6-c5d6-4a78-b860-33856d269027","resolution":{"observed_at":"2026-08-06T10:17:37.876679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.861227Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"a5099a31-8ab7-4902-8ab9-ce415a34ccf7","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.436207Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:25f884f6c1a069060a388ec4e802b7b5a4a18f159b008cfe1d650d588a3891c4","observation_id":"6b4eaf69-63d5-4d3e-b039-526076116065","resolution":{"observed_at":"2026-08-06T10:17:37.865883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.851221Z","title":"Going deeper with im- age transformers","venue":null,"work_id":"73e599b9-1235-4332-8d6c-61d16e86d7ef","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.439493Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:14cf5328e55dce9e21aa9cb3a7ab1bee6f0401fb488de4d6283eae524b2e639f","observation_id":"0bf5102d-bbda-473f-ab54-1960a309c38c","resolution":{"observed_at":"2026-08-06T10:17:37.854690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.841407Z","title":"Maxvit: Multi-axis vision transformer","venue":null,"work_id":"130d1ec5-2ac7-443d-b727-f98caf5ac5a4","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.442742Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:70a57e2abb0f2ced5189d4006f68dfc3c6eeb09b1f55b969073a0dfdac0a3c4a","observation_id":"14b9665d-5370-42a0-8d22-cc78c25c5580","resolution":{"observed_at":"2026-08-06T10:17:37.845007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.830887Z","title":"Attention is all you need","venue":null,"work_id":"23e51f20-08a9-4f34-9f51-0f4f7705b1c1","year":2017},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.446106Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:558a16fa3c776ef873ec412187bc88edaf5c585ce1aff71ac7a4fceecfb7dbd1","observation_id":"9bcea0ea-6be7-44b4-ad3c-ad026ba27559","resolution":{"observed_at":"2026-08-06T10:17:37.834387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.821227Z","title":"Zero- tprune: Zero-shot token pruning through leveraging of the attention graph in pre-trained transformers","venue":null,"work_id":"a9da4c17-c6de-4c73-8d17-f48583221eb4","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.449512Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:cea912afefd786ba6c0b2505b0ea81196d990fa2722f9d4ca8e978fb2b10c0e9","observation_id":"8b041d0c-65c4-4c02-b0e6-f92d2e190a8a","resolution":{"observed_at":"2026-08-06T10:17:37.824802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T10:17:37.453396Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.453396Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:638492ec0f352d6429dfbf777d099214479943610fb29cd198c671a70f3e7d72","observation_id":"92c44c72-d0c3-4353-91af-75db2571b439","resolution":{"observed_at":"2026-08-06T10:17:37.453396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.811547Z","title":"Pyra- mid vision transformer: A versatile backbone for dense pre- diction without convolutions","venue":null,"work_id":"53df3c70-a296-4d34-b7b0-c3b76c9991a4","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.457103Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:f4885a71e07ffd20f174ff5406556bffff89bc8435ef1cea079df782a1090c4f","observation_id":"ac1b6b9a-036f-4ad8-9d3b-55724f101048","resolution":{"observed_at":"2026-08-06T10:17:37.815080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.801347Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"4b7bc55b-59e0-47c1-9c5b-225530edf7d7","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.460526Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:eb6571b45ab3f6c5ddfc8130d4579b07c41e4bdb1156f5d1c645b7f9a09659cc","observation_id":"52d4e181-7df8-407f-b927-937d0a47e592","resolution":{"observed_at":"2026-08-06T10:17:37.805181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.791098Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"c1c606fe-39db-42d4-b5eb-efde749f2fae","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.464215Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:b486bbea02ef33831a86a0ce994ff961c35cb95685f115d511ad925360d7a075","observation_id":"e619fe51-c297-4566-9ff3-7e3e1acf7f41","resolution":{"observed_at":"2026-08-06T10:17:37.795148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.780623Z","title":"End-to-end video instance segmentation with transformers","venue":null,"work_id":"b8e39ded-d73e-4ad6-8bdc-315eca3a6436","year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.468406Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:e210f5ae7ebc30978d0a0945680448429232f0e33674b1a7db57c323da875849","observation_id":"c115fb94-82ea-4ad6-bca8-04856388ac39","resolution":{"observed_at":"2026-08-06T10:17:37.784750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T10:17:37.471841Z","title":"Internvideo: General video founda- tion models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.471841Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:ca1757ab74ee0a16b3bff84ea1dc2c1a1454a8f006c5df97027f2f4efd064379","observation_id":"af83d3d0-c08e-4df0-801c-d839ffb69237","resolution":{"observed_at":"2026-08-06T10:17:37.471841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.770833Z","title":"Anchor detr: Query design for transformer-based object de- tection","venue":null,"work_id":"4b0bdcc9-d592-467e-9733-dd5d974fa6a7","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.475691Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:4945301e9a7af119116f29ec104caaa4ea8c816d4f762975b33768029f9f3ab5","observation_id":"cc388bdd-0203-455b-9c5d-f843b66e5288","resolution":{"observed_at":"2026-08-06T10:17:37.774169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.760149Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"e5460359-520a-46ed-8bf5-06c39cb207e2","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.479042Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:c851b17258f968becf2467927eda06087c7db658c5ec57c711287c634d76bbdd","observation_id":"c03a11d8-a1e7-4826-a084-bfd27914e555","resolution":{"observed_at":"2026-08-06T10:17:37.763834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.749691Z","title":"Con- vnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"07d7359a-488f-45ae-969d-4fd7a445c2a8","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.482459Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:6f4a90b059c9341d0bbf8a50601ee57da758ce8464aa54d10230af7452cb144d","observation_id":"0b896a73-9a0b-4ad8-838b-4919b8b6ed91","resolution":{"observed_at":"2026-08-06T10:17:37.753286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.740334Z","title":"Nystr¨omformer: A nystr¨om-based algorithm for approximat- ing self-attention","venue":null,"work_id":"040c735e-da0e-47f9-b316-b4e1000ba1bc","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.485718Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:10efe25e597a3432355cd057065abc4709e2d7eb8e1efdb83ebb5655208c4ea2","observation_id":"a544daa6-6a46-47fb-acbf-ceaec5123bd7","resolution":{"observed_at":"2026-08-06T10:17:37.743887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.729438Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":"3ce8186b-dd95-4319-8859-8f6258900d6c","year":2017},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.489240Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:3b15b93c2606cfe5dbe691bced8ffc725f6280851476b49023441567846bbf41","observation_id":"283801d2-fc26-4144-bf9a-8786cb511f53","resolution":{"observed_at":"2026-08-06T10:17:37.733753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.717958Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"49dd4f33-a565-4cad-9a92-c281140f8a1f","year":2016},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.492973Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:f454a50b8be894afaad02c2bceedb732f16e64ab3920793b3616b080a4a93764","observation_id":"0118e699-975c-487d-92b8-f0bc85bc548b","resolution":{"observed_at":"2026-08-06T10:17:37.722437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.708036Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"47857a24-efdb-4149-b077-0aabb3337a0f","year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.496571Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:f2bf6fadb53a1c405733eb6fc5b6ed9f886ed694d791471bd61ff7993610ab3d","observation_id":"213a57ad-5390-4905-bb3b-2172a263645b","resolution":{"observed_at":"2026-08-06T10:17:37.711491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.697661Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet","venue":null,"work_id":"7129ccb7-5ab4-4fb9-b83e-e9eeb66e1b25","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.500386Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:7efe2850b5772a4ce32a0b02bc4073ea6d9602b8cc7d6ba5512c345d113d426e","observation_id":"fd4d55a3-c0c4-474b-8d74-891b6d95c682","resolution":{"observed_at":"2026-08-06T10:17:37.701378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.687674Z","title":"Efficient trans- former adaptation with soft token merging","venue":null,"work_id":"9f720799-a42a-4019-9458-126f43472bf0","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.504003Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:d22bf25b0678989b418eb091cff641ac5847bd0f48c2e5e38d6cfa4ce729fb0e","observation_id":"5742a98a-16e4-4110-af82-271f23b7f762","resolution":{"observed_at":"2026-08-06T10:17:37.691182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.675261Z","title":"Shvit: Single-head vision transformer with memory efficient macro design","venue":null,"work_id":"9e7556bb-c6df-452c-9808-289c931b0db3","year":null},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.507550Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:ffe2873c7a3884f31fcc2d9b8cf8e3c70ba891b164cf1550b3a84e5df9f038b2","observation_id":"a4c978cc-7625-4211-b0c8-a4824c0a3535","resolution":{"observed_at":"2026-08-06T10:17:37.679998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.662085Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"c1880ff4-01ed-460f-b50c-9fe111403578","year":2020},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.511003Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:fa3201059a5392116dc07bc5a9c9ac98d3a639f65532a32c68e026d41bd9146b","observation_id":"af6135fd-a25b-4270-ac91-3dd201df9fcc","resolution":{"observed_at":"2026-08-06T10:17:37.666727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.649383Z","title":"Exploring token pruning in vision state space models","venue":null,"work_id":"3b70dd3f-e6ca-4949-ad05-adccb826be1f","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.515202Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:9ab8afdfd48934a4efb33a7293bd106f342bf7f3be98f6f3fa98589d71f95bf6","observation_id":"26b174c5-8778-40ff-aaa6-8aab9f4c9bc3","resolution":{"observed_at":"2026-08-06T10:17:37.653322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.637757Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":"0cc9ab9c-154d-49b3-acde-2a2a91752a77","year":2023},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.518790Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:0f6f12a0bc0d01d6362a4c81102f844c05037a0fcda0cf0801de40d216078ccd","observation_id":"c9395641-687b-41a5-8db5-3a162b80d17d","resolution":{"observed_at":"2026-08-06T10:17:37.641483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.626937Z","title":"Rethinking semantic segmen- tation from a sequence-to-sequence perspective with trans- formers","venue":null,"work_id":"41640776-ea9d-4ba8-951b-4403e8269217","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.522839Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:34f8bd6c744af83e9ba5713c8733a22853d53c9d9ae6afe37f875a01679d74d2","observation_id":"f60e9007-87c7-4010-906c-b1156d1fc016","resolution":{"observed_at":"2026-08-06T10:17:37.630756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.615988Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model","venue":null,"work_id":"d05ea19f-3269-45bd-bad3-c1243cf82ef2","year":2024},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.527326Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:35834118536016454461cb32b14df3c4b3b9e3315ca25e5b5da0d79e042db794","observation_id":"dbfc3aca-161e-40ad-b081-b53ae85b8378","resolution":{"observed_at":"2026-08-06T10:17:37.620217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:37.603331Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"9bc1be32-db06-47b3-b329-71638ff0a75a","year":2021},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.530726Z"},"links":{"citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:a507b62f7932a619bd96e481a41fce53a97d44afd728ff5dfcf47a1f468ee73c","observation_id":"ae973c5c-838a-490a-9df5-644b8e7818e1","resolution":{"observed_at":"2026-08-06T10:17:37.608667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":70},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2508.00367."}