{"as_of":"2026-08-16T14:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b5430e280b51d05684c569e75bd198ef9c6b877a81e80d0d359e1a11154c582","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:49:00.287336Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07110/citation-record","integrity":"/paper/2608.07110/integrity","json":"/paper/2608.07110/citation-record.json","paper":"/paper/2608.07110"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.235140Z","title":"On the optimization of deep networks: Implicit acceleration by overparameterization","venue":null,"work_id":"5c92512b-3119-45b7-b089-a93b04b9660a","year":2018},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.016322Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:57e384b1189cbeb4fb24620135ce540ca488217b08c938395da46c3cb8956b93","observation_id":"54f69f5b-e578-4fee-83be-a52e6e63d074","resolution":{"observed_at":"2026-08-10T14:49:01.238198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.225585Z","title":"Implicit regularization in deep matrix factorization","venue":null,"work_id":"ad41c09e-9dbb-4c4d-a097-92b73a3e4a7e","year":2019},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.028205Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:e9a65b0791066eb587bad8d7eb5ebee28cdec01febf0ba755ae84f0a14bd67b9","observation_id":"93169a85-7ed6-4609-a3c3-5ab3e932fdc7","resolution":{"observed_at":"2026-08-10T14:49:01.228766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.214389Z","title":"Hinton, Volodymyr Mnih, Joel Z","venue":null,"work_id":"72ffa83c-cf5e-43e0-9de9-588a637e1349","year":2016},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.040263Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:40992000a4245f98b01cff08eab1cfe9cf14098a57966418db771f4433cec2c5","observation_id":"6730573d-111b-4c72-aa38-f8fb94991c98","resolution":{"observed_at":"2026-08-10T14:49:01.218663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.048417Z","title":"Neural networks and principal component analysis: Learning from examples without local minima.Neural Networks, 2(1):53–58, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.048417Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:f14077c839bb8b4ae41345f2784d39ddf1b2b4c8cdbb2f0b6e3425b1dbf0430c","observation_id":"a421cb19-3917-4b17-b943-ef5cfe975ce5","resolution":{"observed_at":"2026-08-10T14:49:00.048417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-08-14T11:18:31.036773Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-08-10T14:49:00.055105Z","title":"ATLAS: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.055105Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:471fec0f35e03ce17697bc7fab05f961f9a672e34cf41410b8047e3fcd59fb51","observation_id":"bb89478b-d96b-4b96-9d28-e45638da37ca","resolution":{"observed_at":"2026-08-10T14:49:00.055105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13173","last_updated":"2025-04-17T17:59:33Z","snapshot_observed_at":"2026-08-16T12:10:46.283385Z","submitted_at":"2025-04-17T17:59:33Z","title":"It's All Connected: A Journey Through Test-Time Memorization, Attentional Bias, Retention, and Online Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13173","snapshot_observed_at":"2026-08-10T14:49:00.062746Z","title":"It’s all connected: A journey through test-time memorization, attentional bias, retention, and online optimization.arXiv preprint arXiv:2504.13173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.062746Z"},"links":{"cited_paper":"/paper/2504.13173","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:7cc5d2b63ad5884a6a771359d5f7616db89eda96c3f1f763266d6853c5d51b93","observation_id":"62d26e52-6521-4e6c-9e27-bf5cc56bb33a","resolution":{"observed_at":"2026-08-10T14:49:00.062746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.069826Z","title":"Nested learning: The illusion of deep learning architectures","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.069826Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:b6f138d03d06015330e79f972d1d443ec9e695fc0e6313067a31d5dab2cab9d8","observation_id":"13602867-972b-4bf3-92f4-6d878d6c61ce","resolution":{"observed_at":"2026-08-10T14:49:00.069826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-16T10:45:05.594811Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-10T14:49:00.074916Z","title":"Titans: Learning to memorize at test time.arXiv preprint arXiv:2501.00663, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.074916Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:6b76b28343cba79b7d13de71ff787b3f8eaaca2e52e2cd36716038eb57cd2a55","observation_id":"1764e16b-1a82-42a3-86c2-4d6318689a62","resolution":{"observed_at":"2026-08-10T14:49:00.074916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.202561Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d9470d48-ab10-46cb-a268-71a79f1f90f9","year":2020},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.079715Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:49b76664fb82f577543f7dc87961bcd8fc84af529199d1b8fc54a278fba994d4","observation_id":"10d57bfd-0995-4120-8206-dfe1f3fcb2c7","resolution":{"observed_at":"2026-08-10T14:49:01.206451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.190102Z","title":"Rethinking attention with performers","venue":null,"work_id":"b380ff9f-fda9-416e-9ba9-e824f67557e3","year":2021},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.084826Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:b157300863caa4a5c3d2d43bf2d4f7c79e5f9d04aefefd9b2ec16b53d6ad0ead","observation_id":"692b1449-1447-477c-ab1f-d35945424b5b","resolution":{"observed_at":"2026-08-10T14:49:01.193818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-13T10:35:27.214652Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-10T14:49:00.089876Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling.arXiv preprint arXiv:1412.3555, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.089876Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:6c6f8700ebcf9d9f37b926083a97f8fa8b9feb6dbef7c17df2202f901223d7b0","observation_id":"056f0b74-97af-43f8-85b9-ad3e70e37b61","resolution":{"observed_at":"2026-08-10T14:49:00.089876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.178684Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"b298b3d5-96e9-400e-852c-e9fe6ebdb2ac","year":2019},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.095122Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:99b1c4abce496feba579f22c0db8f6fb8d741770ea383ca15293ebea0bfeedab","observation_id":"14dbc70d-d3f5-4095-a42a-624bb6414d74","resolution":{"observed_at":"2026-08-10T14:49:01.182506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T14:49:00.099403Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.099403Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:6932788ee869bb0b9d880743e8f05c8dc6ffda29a80e0fb15a29f8c82678c309","observation_id":"5d89f1bd-1978-44af-9718-01aa5db2b482","resolution":{"observed_at":"2026-08-10T14:49:00.099403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.165953Z","title":"Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":"69d31102-174b-4946-959e-b1e75bd5892f","year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.103177Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:4eb2b1e448c9c2364fe633f291d16ee2b279cd3ace927996e1943624f3bf9878","observation_id":"bf82f20a-7750-4732-ae3f-fe88db00a825","resolution":{"observed_at":"2026-08-10T14:49:01.170651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.153873Z","title":"Franke, Arber Zela, Frank Hutter, and Massimiliano Pontil","venue":null,"work_id":"20609d70-40cf-46b0-8058-d841d503ee41","year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.106479Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:ce4054f2a40e28624dedc126be87f25c9e45fd3dc72c7bc79172062e93a9af7d","observation_id":"edbad945-5edf-4362-a22a-2a340046041e","resolution":{"observed_at":"2026-08-10T14:49:01.157640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.109640Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.109640Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:9cd4c01226b7c968a753a75662073ddbd30993c97aa4614c3262262e3b377075","observation_id":"af3fce11-cc82-4d10-94d8-f57f00b21506","resolution":{"observed_at":"2026-08-10T14:49:00.109640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.135600Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"c4258cb7-3fac-44b2-8818-53da368affd8","year":2022},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.113905Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:a4e54a7a2dac3d03fbeaebfff0d12d3df1db442966d2f19c6c5bc838404ec5e1","observation_id":"325b2e00-be01-426e-ba81-4761d756fa57","resolution":{"observed_at":"2026-08-10T14:49:01.139876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01643","last_updated":"2026-04-20T11:19:37Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T13:14:48Z","title":"ViT$^3$: Unlocking Test-Time Training in Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.01643","snapshot_observed_at":"2026-08-10T14:49:00.117602Z","title":"Vit3: Unlocking test-time training in vision.arXiv preprint arXiv:2512.01643, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.117602Z"},"links":{"cited_paper":"/paper/2512.01643","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:b631a85c9f3c6140f8a47e34b8631a79d8f5f43c14a1cfd7504d887a7ffdf3dc","observation_id":"0b6c36a8-a359-48c3-bc74-34c67ab3218a","resolution":{"observed_at":"2026-08-10T14:49:00.117602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.124509Z","title":"From one tree to a forest: A unified solution for structured web data extraction","venue":null,"work_id":"0550638f-c12a-4f00-baa8-af1e250cac86","year":2011},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.121976Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:5574c0fb904817c9bf1e52eadfca8ade8520215d4bddb0db01d2c1f4118b6993","observation_id":"f88e6d24-502c-4c2f-8d00-9a69f73e9e10","resolution":{"observed_at":"2026-08-10T14:49:01.128261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.126571Z","title":"Long short-term memory.Neural Computation, 9(8):1735–1780, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.126571Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:ea4f9b1ae691555aef407bbd47d2d3dc798b8323e37b657565939cca76c2e1ce","observation_id":"48aa90e4-3511-4386-bcca-b59e8de36d13","resolution":{"observed_at":"2026-08-10T14:49:00.126571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.131180Z","title":"RULER: What’s the real context size of your long-context language models? InFirst Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.131180Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:1b4f5ac1535d2dbcd2b61b900228e1363e4167a37930adf21ab283a28ebb7390","observation_id":"31df3935-0d8b-4018-9201-a2927ac71ecb","resolution":{"observed_at":"2026-08-10T14:49:00.131180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.098154Z","title":"Going beyond linear transformers with recurrent fast weight programmers","venue":null,"work_id":"894aa2a4-8dae-4867-9288-6c8e50305730","year":2021},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.136092Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:b744cb9e3c91fd72d08e8e7efa1fe88b122818ba57aa4e56d4b76b7bfe5fdcf8","observation_id":"267b3cba-d8c3-4c2e-9a94-7fcc54ec57e0","resolution":{"observed_at":"2026-08-10T14:49:01.102273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.085749Z","title":"The dual form of neural networks revisited: Connecting test time predictions to training patterns via spotlights of attention","venue":null,"work_id":"116ea899-634b-4d45-9383-36b9b0e86342","year":2022},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.139906Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:631bad5e03743fc47d3d4122b8a11f79f3ce4e426360a1b2b341e43ad79e976a","observation_id":"8be17c1a-6117-4749-b5dc-38ddb220af46","resolution":{"observed_at":"2026-08-10T14:49:01.090105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.074208Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":"4e1099c5-33eb-4da4-a268-1d5280bf4c43","year":2020},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.143974Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:16dec9a7b4c953b2c9c09bc72e356b15265f0c0778bd69a1fee58a5edd635e78","observation_id":"70f3126e-48a4-4343-9d51-8c33a100591c","resolution":{"observed_at":"2026-08-10T14:49:01.077490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.064325Z","title":"Deep learning without poor local minima","venue":null,"work_id":"ac574429-caf0-47b1-ad87-97364b87f516","year":2016},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.148270Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:e5a601be868309dce3b56aed4813fc35c560335ced340a208ab69e80f3115353","observation_id":"9262bfbf-5041-416a-a017-8510e3b1894c","resolution":{"observed_at":"2026-08-10T14:49:01.067657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.054049Z","title":"Dynamic evaluation of neural sequence models","venue":null,"work_id":"6ae00687-e1d5-4412-8543-f2c211be7d94","year":2018},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.152758Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:75829007cd268e696303e9f480747e2fc9a9e891c73a904440c234a6c921710f","observation_id":"a9d1755a-4481-4555-b48d-7ad3a0ba7230","resolution":{"observed_at":"2026-08-10T14:49:01.057529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.156495Z","title":"TNT: Improving chunkwise training for test-time memorization.arXiv preprintarXiv:2511.07343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.156495Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:4f6df1d23805753fa184186ddcac8c3cd5c5ffd0b91bd18b644af9744d7acfb2","observation_id":"ddad8e1c-8091-46c5-a150-e1fb20462d67","resolution":{"observed_at":"2026-08-10T14:49:00.156495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.043636Z","title":"Parallelizing linear recurrent neural nets over sequence length","venue":null,"work_id":"4aca0502-d09d-484c-8233-d65c53ebc6bf","year":2018},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.162359Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:930c03190bc1c5aba590217b7490938f4284f41ba71484ca384225f4c393c67a","observation_id":"25a2d7c5-6219-43c9-8a83-3c311747eb22","resolution":{"observed_at":"2026-08-10T14:49:01.047102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.167071Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.167071Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:94189b61b467283b0d54657d9aff8f0a8739684efcbb1dba8f83d0cba6166aa6","observation_id":"564325e4-01c2-47db-9436-4447cc5d660f","resolution":{"observed_at":"2026-08-10T14:49:00.167071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.026625Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"0a9e8a4d-66ac-48fe-8749-68a7196daf17","year":2018},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.171809Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:96ecbfc381fcad9cdb4cca9a70bc9023c8626f5adfcb5888ea36fbd63efe5f21","observation_id":"9c06a6d2-d897-49be-b8fe-a49d2299f766","resolution":{"observed_at":"2026-08-10T14:49:01.030328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:01.016052Z","title":"Smith, Albert Gu, Anushan Fernando, Caglar Gulcehre, Razvan Pascanu, and Soham De","venue":null,"work_id":"effc143a-7aa1-4a8b-ba37-45c0fa93a99d","year":2023},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.176951Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:11a47dd86a3ac1887389708c2e2dcf7448bcac042dd63e85d92be5cc359bf2d0","observation_id":"710b212d-b687-4bc4-b7eb-e27242249bb8","resolution":{"observed_at":"2026-08-10T14:49:01.019664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.181836Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.181836Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:88411781b3d10211f3f70b8350266831824029ca6db194c751e2f1c2d961c374","observation_id":"61c8aa02-114a-473f-b586-de04378b83ad","resolution":{"observed_at":"2026-08-10T14:49:00.181836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.998414Z","title":"RWKV: Reinventing RNNs for the transformer era","venue":null,"work_id":"73f8a513-d576-4bce-9bf4-c56f2f25704c","year":2023},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.186443Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:6fe6a42b07f0a6695eaa426fd1135d6b8496de480837949e50759ad635927e9f","observation_id":"a81b0870-2a0b-437e-914c-5f34bc76fe85","resolution":{"observed_at":"2026-08-10T14:49:01.002311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-08-16T12:48:54.019542Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-10T14:49:00.197808Z","title":"Wind, Tianyi Wu, Daniel Wuttke, and Christian Zhou-Zheng","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.197808Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:226c20ccd61fe3ce2983e873becf48665d853bde7877cd407092eca2ac7e4ba1","observation_id":"bf0aa4df-1a98-4374-809b-f797b99fd307","resolution":{"observed_at":"2026-08-10T14:49:00.197808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.987477Z","title":"Hierarchically gated recurrent neural network for sequence modeling","venue":null,"work_id":"bd2eafca-2df2-4708-9c19-5887cebad77d","year":2023},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.203556Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:3944faebb74f7668400ba125885f5225b390e7447449b0d1223cfc2c9b1d107d","observation_id":"6d6133eb-7196-4208-a829-fa7ee7af2776","resolution":{"observed_at":"2026-08-10T14:49:00.991144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.976158Z","title":"Transnormerllm: A faster and better large language model with improved transnormer, 2024","venue":null,"work_id":"332b96bd-409f-4034-875e-36c46a0ef065","year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.208730Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:5662ac87aa4af778197c38f9d10f81c62c1d9b5f59dfab96ca46d747e0b7ddbc","observation_id":"73db6233-bc09-4ed0-b9a4-415b42dfa82f","resolution":{"observed_at":"2026-08-10T14:49:00.980209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.965211Z","title":"HGRN2: Gated linear RNNs with state expansion","venue":null,"work_id":"033f5a87-d5ba-4bb9-8360-1f8eae47231b","year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.213273Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:6f619387c577afd9ad11a73f944d7d9b2b3a78e78063bc30d3ce8c7d6260e5f5","observation_id":"af4f3e44-7159-45f7-bda9-237cc26820f2","resolution":{"observed_at":"2026-08-10T14:49:00.968910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.218216Z","title":"SQuAD: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.218216Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:fae8f44021989b3169d7079dadfb6fe985cfc6d27533b3d9ed1ecb652a8e7762","observation_id":"6641f328-5cf8-4b01-b226-9c12dd49536b","resolution":{"observed_at":"2026-08-10T14:49:00.218216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.947717Z","title":"WinoGrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"9deaceb2-830f-439f-ae81-bd8be11dc284","year":2020},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.222417Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:1ea774138e2fdc0fbe910c8b4d23a3c7a247434363a1a493e1982dfb89ae5f0c","observation_id":"ce73c9e4-ded9-486f-bc43-f6884fcdca62","resolution":{"observed_at":"2026-08-10T14:49:00.951506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.225911Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.225911Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:44bc39e89d42c7e7caca79b6aeacfd5695cbee22b9516b4f1b7af1a176414582","observation_id":"a2a7953b-474c-4a7e-b25d-cc4613367295","resolution":{"observed_at":"2026-08-10T14:49:00.225911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.937213Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"f60c7f35-33f4-4d10-93cb-506ed7fd3add","year":2021},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.229943Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:a281a9951450cc038cb75d9023acd5d2e95bfd8f3d35155d66ca97e359ef5177","observation_id":"03f41048-f7f9-4e32-bdc6-bcfbe2f42dc7","resolution":{"observed_at":"2026-08-10T14:49:00.940999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.233898Z","title":"Learning to control fast-weight memories: An alternative to dynamic recurrent networks","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.233898Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:2bf608da7946bdba3161f29ecbae9c32a5d53969ede596b40d73bd9123ba9f5a","observation_id":"4ff1a3bf-f54e-4bc5-9820-accc5eee0f4f","resolution":{"observed_at":"2026-08-10T14:49:00.233898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-10T14:49:00.237614Z","title":"GLU variants improve transformer.arXiv preprint arXiv:2002.05202, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.237614Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:22f7e69e2d76ffd1d0a83ddb6648658868caada16b43d9b368369e53a8debd99","observation_id":"ca97b709-115f-4030-b3c5-eaef2ff1eda0","resolution":{"observed_at":"2026-08-10T14:49:00.237614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-10T14:49:00.241580Z","title":"Learning to (learn at test time): RNNs with expressive hidden states.arXiv preprint arXiv:2407.04620, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.241580Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:ef95556e2eb65fe913fe6f18eb106a4b676ae650102158e6e514b8d39063d731","observation_id":"e45efd3c-af20-4927-b8a6-a28cf359f19b","resolution":{"observed_at":"2026-08-10T14:49:00.241580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-10T14:49:00.245361Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.245361Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:539419b76413e3d2cdc74c43ee86422ef04c7846c394777a41ede655b1713958","observation_id":"65a79c75-62d9-4320-a00a-746f23c71e44","resolution":{"observed_at":"2026-08-10T14:49:00.245361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1673764","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.671896Z","title":"EleutherAI/lm-evaluation-harness: v0.4.9.1, August 2025","venue":null,"work_id":"cd511bca-75e0-4581-a2f3-cbc6c9abce5f","year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.249317Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:a5861ec2f50b6e33e7cfa595246e335c180b9f060e946dbaecabbc18fd8c5fd2","observation_id":"83684bd4-51b4-48e1-a583-5cfa26f3f7f7","resolution":{"observed_at":"2026-08-10T14:49:00.677903Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.253011Z","title":"End-to-end test-time training for long context.arXiv preprint arXiv:2512.23675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.253011Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:57d4ea0b604e7965ce45940535807aba193c4e0f19c486efb1f21144721097e6","observation_id":"7bfe8203-8b45-4575-91cd-4f0d76c38224","resolution":{"observed_at":"2026-08-10T14:49:00.253011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T14:49:00.256877Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.256877Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:f3ee850a246322aee6cb153de6093773694054ae906f27f27bfebe39424dccf8","observation_id":"4935ff79-8dc5-4528-9862-470ec2672f27","resolution":{"observed_at":"2026-08-10T14:49:00.256877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.260267Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.260267Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:29f6febad2b41f39445b470c30ff18c8dcb40b492fbe879f982a7056cdd06a9f","observation_id":"21cb32cf-e408-4111-9078-85bdf6f1ad7b","resolution":{"observed_at":"2026-08-10T14:49:00.260267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.913528Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":"71a3f507-54cb-4dea-a730-8db3824a9fbe","year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.263700Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:480b17ca01e3c3c12960181b3855ddfb46e743a258408dbe8439aeb45044a5d1","observation_id":"82b5d303-7481-4e2c-948b-ac31f11357df","resolution":{"observed_at":"2026-08-10T14:49:00.917146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.902827Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":"e489f78e-fde3-46a6-943a-ce3e8ccaad4c","year":null},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.267381Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:93d963be8828ac70a4c176af81e492f6211ba91f9c290050ba9019b612a4e61b","observation_id":"e5ba8a6c-2dd2-47d7-945a-11c9f8f58f44","resolution":{"observed_at":"2026-08-10T14:49:00.906742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.892800Z","title":"Gated delta networks: Improving Mamba2 with delta rule","venue":null,"work_id":"5cbea637-a63c-4189-a1be-0faa449c589e","year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.276006Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:759e61017984a2ef12cd6a2c5688b1bc57226907f4c169ce6e37f714558f3250","observation_id":"5c7bb804-b8e1-43a0-a80f-838c4746f48a","resolution":{"observed_at":"2026-08-10T14:49:00.895958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.883303Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":"aa1522e6-9bc6-497f-8a50-6dc2effb0399","year":2019},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.279697Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:c8e8ca78df0da996318f3d2f99a354cc6c20dc06bff022061210a1681d1a7cb6","observation_id":"587bd39a-dcfe-43af-88c8-205b788fbda4","resolution":{"observed_at":"2026-08-10T14:49:00.886720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-08T17:47:51.120243Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23884","snapshot_observed_at":"2026-08-10T14:49:00.283551Z","title":"Freeman, and Hao Tan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.283551Z"},"links":{"cited_paper":"/paper/2505.23884","citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:f11247f0ae8eb60a40818600fa3fc816dfd5211e53c7d6b9d0c7e92d3720c5ee","observation_id":"0d2aeadd-eed9-45f1-ad33-510559b37cde","resolution":{"observed_at":"2026-08-10T14:49:00.283551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8673.02053","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.495423Z","title":"Flame: Flash language modeling made easy, January 2025","venue":null,"work_id":"c40ab31f-7e91-48e7-b835-b081e419ca94","year":2025},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.287336Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:47f31207911ba691d3840693f489c5ab8d8151584ec6363374ee21f6f5541fb4","observation_id":"5b99afcb-f203-48c3-a0a0-886ce4aa0881","resolution":{"observed_at":"2026-08-10T14:49:00.503888Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.192739Z","title":"doi: 10.18653/v1/2023.findings-emnlp.936","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.192739Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:ecb53007996505c8b978f51aa9b0291b5c09f06a50210d20178561d2c858989c","observation_id":"3c6a42e3-0169-4228-9457-d9f170eb2fd6","resolution":{"observed_at":"2026-08-10T14:49:00.192739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:49:00.272250Z","title":"URL https://proceedings.neurips.cc/paper_files/paper/2024/hash/ d13a3eae72366e61dfdc7eea82eeb685-Abstract-Conference.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T14:49:00.272250Z"},"links":{"citing_paper":"/paper/2608.07110"},"observation_digest":"sha256:8178b96df666a586c89756efbf239607e1499c2523d409684d2e46bca0afe792","observation_id":"385df1d3-c6f8-4acd-8e90-59fb2a6a3779","resolution":{"observed_at":"2026-08-10T14:49:00.272250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07110","last_updated":"2026-08-07T11:11:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T23:02:58.572387Z","submitted_at":"2026-08-07T11:11:43Z","title":"Modular TTT: Rethinking Test-Time Training as Composable Modules"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2608.07110."}