{"as_of":"2026-08-05T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:377ece725f9ae58df0ce8951c9216a73d8fc28af512bbc8edc8574acc437bf7c","coverage":[{"denominator":117,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T15:27:55.566795Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.05838/citation-record","integrity":"/paper/2605.05838/integrity","json":"/paper/2605.05838/citation-record.json","paper":"/paper/2605.05838"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:32:56.785876Z","title":null,"venue":null,"work_id":"957afa65-c231-4cd5-86ef-e3d6eed4e5c6","year":2026},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:be327aaaac15575e2cca4e96cde23f876cbd1ad598b940eda6b98a1aad2bea2d","observation_id":"7c516544-654e-4dbe-a5a4-127f8d22ce6f","resolution":{"observed_at":"2026-05-26T01:11:27.683161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient","venue":null,"work_id":"467915e9-80c0-4450-a95c-436ef080cfc0","year":2026},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:98abbb71c79e2e007a15accf847c09f737c9ed514453e825428042f142d2a863","observation_id":"582e5d35-8076-4dd8-b87c-d4ab805b982b","resolution":{"observed_at":"2026-05-26T01:11:27.686994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Control Fast-Weight Memories: An Alternative to Dynamic Recurrent Networks , year=","venue":null,"work_id":"a1081c90-67c4-463b-822b-6c1f6b78fe2d","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:eb16e2495dc49a592189f35168f580fb86377d23c16ee40c6042f8335e118d3c","observation_id":"0900f9ec-807b-4926-9cb6-594e95e39f29","resolution":{"observed_at":"2026-05-26T01:11:27.865849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2402.19427","doi":"10.48550/arxiv.2402.19427","metadata_source":"pith","pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","venue":"cs.LG","work_id":"546b02db-26f0-4dac-b50e-912e7f4e181c","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:5b21a4358dbefde014f41747dea58c92e28926e6fb106c4800c06797374ef33c","observation_id":"64cc7df7-1c6f-4b56-b12a-afdc3eb9d202","resolution":{"observed_at":"2026-05-15T06:58:17.635264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:13:30.255690Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"963d5db1-2388-4ab1-a52a-87d0137af3a5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:3f753d1bc00f6caeae107847b04fd2a725c26a26fc09763f9081e7ca2f7b544e","observation_id":"bbdc15e3-2f13-4ae6-ad68-d4fdf8136391","resolution":{"observed_at":"2026-05-26T01:11:27.846209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":"2305.13048","doi":"10.48550/arxiv.2305.13048","metadata_source":"pith","pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RWKV: Reinventing RNNs for the Transformer Era","venue":"cs.CL","work_id":"524dc80d-f4ef-4f89-bf1a-9a8c1e4b6a81","year":2023},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:a337b140e22fba72eb4aaef474e3a57871afebb130d4545e53398817700c8e6b","observation_id":"42a438c3-38d6-40ef-b63b-f9fa235a66fe","resolution":{"observed_at":"2026-05-13T10:53:42.104933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are","venue":null,"work_id":"e68caa83-ade5-4b86-9247-1a942ef61020","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:3eb334c74fb867f9c1fee0b9f64b83615364c510277990ae3d48447c7e9bcdf9","observation_id":"d04f00f0-e850-443e-9442-0c593cc7abf7","resolution":{"observed_at":"2026-05-26T01:11:27.870264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"1d691d49-4518-423c-b76a-5779b9681fe8","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:1ea935bbcdada087a14f40d398d2297442965af8943e924d03790e1f25b835fc","observation_id":"e49e0c6f-e408-4e97-a2bc-689a0a959846","resolution":{"observed_at":"2026-05-26T01:11:28.110412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":"2404.05892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-07-04T10:09:43.990339Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","venue":"cs.CL","work_id":"b993c2c1-c4d3-4ade-a380-dc5464bcb940","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:6ddd4cd352b6c8c6028983db35c4fdf7e4374bbbc7c36fc1139753bb6d76ac83","observation_id":"878ac054-eea8-4bf8-9806-2198a568a91f","resolution":{"observed_at":"2026-05-17T23:19:58.366890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-02T09:26:59.716070Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":"2009.14794","doi":"10.48550/arxiv.2009.14794","metadata_source":"pith","pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking Attention with Performers","venue":"cs.LG","work_id":"4c26d308-8b72-4a98-8e73-950617a75f50","year":2020},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:e2864f07664fde11db5aaec03c87335cd290f2c5b1cf8c21a38fca7452786b49","observation_id":"27664b43-4d77-460c-9af1-60e645b1f7c1","resolution":{"observed_at":"2026-05-12T09:16:14.972905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.959694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.12608602","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:45.648157Z","title":"doi:10.5281/zenodo.12608602 , url =","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"2c57f331-c45e-4b28-9887-1931db7da39f","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:a755344b5127c1706b0ccbad29ceb19fc172743b839581760cfdb89d30645e46","observation_id":"2c1f96a5-25f6-4e99-b9dc-0fc756285456","resolution":{"observed_at":"2026-05-09T22:03:56.083170Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:137615a82573ef2b6d263fdc649ef1d097c37f1b0743f50acf4ef007a2ee676e","observation_id":"5b62bcef-a740-483a-a72d-a703eb7d64b1","resolution":{"observed_at":"2026-05-13T09:46:19.833273Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":"1809.02789","doi":"10.48550/arxiv.1809.02789","metadata_source":"pith","pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":"cs.CL","work_id":"b9d68fc0-5b23-4def-bc5e-6ad71d64eec6","year":2018},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:37e42d88d16c6bf5a7e9c7f37018c76fb886a86cbd857e3269345273c4656d4f","observation_id":"9cfaf95f-8c16-4939-8cf9-e9dd536b81fd","resolution":{"observed_at":"2026-05-13T08:14:48.923977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scientific Reports , year=","venue":null,"work_id":"52b8fd1e-c821-4bdb-978c-9ada35364fb7","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:d4e20a60313dfa4bd946bc8275b05ad228fd55654eaddb2dcbd0a30e3ef911a4","observation_id":"8efea4c6-f14a-43e0-b5b6-fa1c3cd4cbc1","resolution":{"observed_at":"2026-05-26T01:11:27.995102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:84058d62a7eb309bf34407885f4e05f66ed76a6673a5b3f7547a02aca2c39a1c","observation_id":"55b178a0-adad-4687-b348-e3a1e37d7e67","resolution":{"observed_at":"2026-05-11T16:41:10.885292Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.719660Z","title":"Communications of the ACM , volume=","venue":null,"work_id":"945bb9f7-1eca-4317-8f33-82fe8b6fdeef","year":2021},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:fad23f73ec05d6b7feef003626a33528c5c36ee27b6e1cf9100606c3c432c5a7","observation_id":"122f1d8e-4e6a-4111-822e-3a62d253029a","resolution":{"observed_at":"2026-05-26T01:11:28.023693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":"1905.07830","doi":"10.48550/arxiv.1905.07830","metadata_source":"pith","pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","venue":"cs.CL","work_id":"79f44c0c-96f4-4edb-bc50-a3c9d6b85936","year":2019},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:414d9b286d3ba0308c27075252e7814c718c19fe0f827ad4aa65af8d4e1435f4","observation_id":"d6d7df26-c965-4740-b509-cb5f9b48179b","resolution":{"observed_at":"2026-05-11T16:41:10.906461Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:36:12.790467Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":"b02622aa-75de-4289-92a8-bd2b7de82f38","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:7b4124a51be9ad8b72ce2b8e5c49b1d7a49978614f3898eb407becabe77d10a7","observation_id":"831fcc12-4502-42a3-b159-4d73c08a74f5","resolution":{"observed_at":"2026-05-26T01:11:28.061126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 54th annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":"a1d10557-3cc6-4973-823f-a63886a433a5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:e4c34cb7b8dc303ca7f56f08838e190300a2b08901c7b6888889f78f63457183","observation_id":"25b4b976-7a14-4747-af2e-c776fde54afb","resolution":{"observed_at":"2026-05-26T01:11:27.907266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:0c924c37fde24b531602f3829c529c2921b6f5094cc3f48ce0e9f0b85aa6b50a","observation_id":"1f34e914-eedd-4912-8139-df6ad0846246","resolution":{"observed_at":"2026-05-11T16:41:12.012830Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T02:03:09.996518Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"74ced095-3a30-482c-814d-a585079e4d5f","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:8973d68ee1b5ecbffe6b8f016129b1d063d97e3e8efe7a5fd69c7360a351f223","observation_id":"1f1a7fdc-c3b3-40a4-8469-58691111610a","resolution":{"observed_at":"2026-05-26T01:11:27.951700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:6ab5425e4b822c39ed7e3d7c2804e9d309b1f4731ed1d6566f63d639ed32796a","observation_id":"7197c207-71d2-4d9e-a357-c3cc7c37eec0","resolution":{"observed_at":"2026-05-11T16:41:11.022203Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.568147Z","title":"Neurocomputing , volume=","venue":null,"work_id":"0cfd4ae7-837c-4c4f-bf6d-afc10f5a8ed1","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:3d2e20f32cef4463d4967aa330b6a6994211aa46f7074d8f2550f929902d7e67","observation_id":"11761ef7-8ac9-4213-b8fa-18666253fd4f","resolution":{"observed_at":"2026-05-26T01:11:28.089265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":"6ec71f69-8cc0-42fc-b376-ace09d54d392","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:a3957963b50d94054bfb3f8d7de05435d9c7c0f282e2bdb9306be24cbde6cdcf","observation_id":"1c8a87eb-a27f-49bb-8f78-8edb54590afc","resolution":{"observed_at":"2026-05-26T01:11:27.837646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-05T07:11:50.808005Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":"2312.04927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-07-03T13:48:20.285344Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"a51e0ddf-22e2-4d3c-9759-7201f7d9a699","year":2023},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:b48b91daadc4e383a9858fe23cb68234a5a8877c8102db010c5832be7e35e992","observation_id":"2dd398b1-dca0-48cf-b97d-8f94c1978475","resolution":{"observed_at":"2026-05-11T16:41:11.061168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"8e2de46f-8edd-4979-b304-fdaa188af5da","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:3ca715d08f7c69d5612cb451a98473b152104a8c9a9a6f330db5abb11b054895","observation_id":"f517436c-9289-44e1-9346-880791572937","resolution":{"observed_at":"2026-05-26T01:11:27.853750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature communications , volume=","venue":null,"work_id":"0eec3244-3f02-4cb0-a95d-2053c22af772","year":2020},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c1e825c231c0821aa2ba7d8174e17f979461ee9764fc29ca2b778ec0f9d7f27d","observation_id":"84245d21-4c15-4db8-9549-d3e253c3c1e2","resolution":{"observed_at":"2026-05-26T01:11:27.857330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural computation , volume=","venue":null,"work_id":"565b0ddb-b4f1-4635-80ae-1db6f7e1ecee","year":2018},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:e7cf8a3f7b2db52c5952d0cf89fc05539418d7e15b12daaeda6930c77a796652","observation_id":"f6df6f2a-271f-4599-a986-84fedb194a7b","resolution":{"observed_at":"2026-05-26T01:11:27.849672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"e1dbf695-cf9b-464f-9ad7-591d3c978d3d","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:7585561cb8569197f47c608dcf966877cd169bd79339b5ecef7319d72cbb58b8","observation_id":"e604a721-54e7-4f37-a851-60ae03f0cde8","resolution":{"observed_at":"2026-05-26T01:11:27.690873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"9480fc0d-0a0d-4666-9df3-48c3f29ed5d5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:04454b028c02d80f4cb6756c3f94ea0ce1ac0fdaf1c665e554189a9fb25fee28","observation_id":"b8e3c107-c574-42f5-a860-454a88b69552","resolution":{"observed_at":"2026-05-26T01:11:27.695068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.119721Z","title":null,"venue":null,"work_id":"1bf2a8ec-755d-4fd0-8d47-61163c015570","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:75c91b73595e6dd21cca84aaef4ad8490e570e3a341841e1d34119fe882bbaf4","observation_id":"0b68dfe0-3e66-4f30-90c3-535a2b3d7dab","resolution":{"observed_at":"2026-05-26T01:11:27.861054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of ICLR , year =","venue":null,"work_id":"e7d3f7c9-7fbf-4f3f-8986-1d82ce49cd60","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:338f99730872c52167fc05f393ea40628836694fce220c8a11b035ea2a17c6ab","observation_id":"aa8ec997-e33d-49b1-9135-8ed8b91857fd","resolution":{"observed_at":"2026-05-26T01:11:28.077873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of NeurIPS , year =","venue":null,"work_id":"d4e389fe-c9fc-4a58-bdca-90fb272af6d5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:96c7da40e866c9557fe88c15d603cb1aa13ec4795fd2766b2966f07f57914ed0","observation_id":"4cff37f9-63c5-4a8f-b2aa-3446afbc33a0","resolution":{"observed_at":"2026-05-26T01:11:28.081780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of NeurIPS , year =","venue":null,"work_id":"75647294-32ef-4c79-974c-f3c2e32e59e5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:52ca097aed2074a144ec82d2b9c99514d76d4424e327ae2a4db87235c0871f7a","observation_id":"0f92bc03-d9f8-4979-9c90-d08f613990df","resolution":{"observed_at":"2026-05-26T01:11:28.093365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of COLM , year =","venue":null,"work_id":"54d7c24e-b794-4bdf-82a8-5d65afbd5bcb","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:9064c41392fde5d878b5d3ddd1a030713daf1825c378c8cb1c89d13bcf38bc01","observation_id":"1ef89d58-2fc7-4c3a-b07d-8c6a39eaf3cb","resolution":{"observed_at":"2026-05-26T01:11:28.098139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of ICML , year =","venue":null,"work_id":"715ee3f5-987b-4d38-a325-ecb40df0486b","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:bb43706e9c88aefeaa3be15b55c48182795a8792b08276ecac2eb3ce9f041371","observation_id":"03bb75b1-97bd-429a-af0a-394679203830","resolution":{"observed_at":"2026-05-26T01:11:28.085169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:11f8eff5207a856b76cfcc31d7bafdbe9be3a8c1e064529fb3b2de3fb84b6293","observation_id":"afb90c36-612a-4402-8e2f-d064a24b2335","resolution":{"observed_at":"2026-05-11T16:41:11.949127Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.757209Z","title":"Transformers are","venue":null,"work_id":"091f0b28-fa4c-4869-9142-d1c2fdae8067","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:7c19cc9918873748ce1846f03b0e97cc6be9a5681f3816b090a6205fc788d5c4","observation_id":"445a23c6-9766-4636-ab56-e96de769e81b","resolution":{"observed_at":"2026-05-26T01:11:28.057033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-02T10:36:55.936254Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"cited_work":{"arxiv_id":"2505.23884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23884","snapshot_observed_at":"2026-07-09T18:46:26.540032Z","title":"Test-Time Training Done Right","venue":"cs.LG","work_id":"12c91551-57e9-44df-bd50-62bbfc4b6f67","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2505.23884","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:d531a31d0119ff709bd431757d654b402f646c18b8f7d116706bf6dc0fec0c00","observation_id":"e89d7ecd-a72b-426f-aeaf-daa5d588f2e3","resolution":{"observed_at":"2026-05-16T11:25:45.463576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23735","last_updated":"2025-05-29T17:57:16Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:57:16Z","title":"ATLAS: Learning to Optimally Memorize the Context at Test Time","version":1},"cited_work":{"arxiv_id":"2505.23735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23735","snapshot_observed_at":"2026-07-04T19:30:07.282576Z","title":"Atlas: Learning to optimally memorize the context at test time.arXiv preprint arXiv:2505.23735, 2025a","venue":null,"work_id":"88ad83a5-1a41-49a6-a975-2d9374634987","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2505.23735","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:9366e2436e9dfb55318f89b0fd27b8486b56b5b900167f32435ce8e6ab41482d","observation_id":"375b403f-05fe-4862-b9f6-83e1e723134f","resolution":{"observed_at":"2026-05-11T16:41:11.660371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year =","venue":null,"work_id":"c2d69b8a-2e4b-49a2-9268-0279c0a49e2f","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:ef1efbdae7b0752bb4473ab559ebe41b620924ce981ffda727cde5a8ddc669cb","observation_id":"e6bb0152-b23b-4d91-96b1-dcae2c3b1e2b","resolution":{"observed_at":"2026-05-26T01:11:28.069648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"16b1eb33-eacf-47a1-9e27-216913929d4c","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:f87248480a592183fa6c25e9d4e041f3b4b14bbc5ce8824eebb2ca9b1425c3a2","observation_id":"364e1f7f-c413-4896-8c21-c081f524fdf6","resolution":{"observed_at":"2026-05-26T01:11:28.052642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05233","last_updated":"2026-06-03T16:16:54Z","snapshot_observed_at":"2026-07-06T21:37:23.562748Z","submitted_at":"2025-06-05T16:50:23Z","title":"MesaNet: Sequence Modeling by Locally Optimal Test-Time Training","version":2},"cited_work":{"arxiv_id":"2506.05233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05233","snapshot_observed_at":"2026-07-04T19:30:07.288376Z","title":"Mesanet: Sequence modeling by locally optimal test- time training","venue":"cs.LG","work_id":"a56c0fb5-cd81-4e5e-982f-7cd7eef43563","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2506.05233","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:f63a16f06a908abe40d187ab3805c434c8e39eb1589ba47d73b1dccf69ed2ab3","observation_id":"35b8ba6a-ac98-4d10-9673-adfba8487771","resolution":{"observed_at":"2026-06-04T02:07:39.171975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"5b3c7fa7-c0b4-45b7-bdcf-0be41a145439","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:d85aa3aa35b581f1ca438a59347d21b35f1b5c08ae5084b99d5d625cbf0dbe67","observation_id":"82767a50-8c54-46d7-8d06-dec2bd25cd80","resolution":{"observed_at":"2026-05-26T01:11:28.039917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14456","last_updated":"2025-03-30T13:46:44Z","snapshot_observed_at":"2026-07-31T02:38:42.580244Z","submitted_at":"2025-03-18T17:31:05Z","title":"RWKV-7 \"Goose\" with Expressive Dynamic State Evolution","version":2},"cited_work":{"arxiv_id":"2503.14456","doi":"10.48550/arxiv.2503.14456","metadata_source":"pith","pith_arxiv_id":"2503.14456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rwkv-7\" goose\" with expressive dynamic state evolution","venue":"cs.CL","work_id":"daf20308-c801-4745-a147-a1f1de4368e0","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2503.14456","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:06fc26009fdc5c3ad0daa0230417ded7d93cd18ae85ba657e81306c6c22f2fca","observation_id":"59cd85ba-9cd7-4b21-aab6-0b75b3114b15","resolution":{"observed_at":"2026-05-11T16:41:11.218426Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"1432f44e-9780-42ee-80c7-ce157a12e773","year":2020},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:53f9dad6fa4fe3aec503127af163355c4ce5cfd1459484a628edbd5fc5135347","observation_id":"84e6b67d-c082-41e6-b955-5bfee24d695d","resolution":{"observed_at":"2026-05-26T01:11:28.035905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the ninth annual conference of the Cognitive Science Society , pages=","venue":null,"work_id":"e8c95b84-7855-4d18-9ef1-70b833dc37fd","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:d7b4f32b068bcebb0e35ad2960f09cd9963400999cd47c84ac82c0d1cfdc57a3","observation_id":"279e3696-3769-4d8c-99a3-760f60fd37ad","resolution":{"observed_at":"2026-05-26T01:11:28.044028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Computation , volume=","venue":null,"work_id":"1bda96a6-6a4a-4218-9159-97c361087492","year":1992},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:66967d1361a2241de831970ebcd678ddc86ed846f362fe6f0051a9aa2ce3dce3","observation_id":"bbd627c0-cff0-4aa3-82f9-1f448342f162","resolution":{"observed_at":"2026-05-26T01:11:28.048095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"e9cdfc23-b789-4b7f-9065-4a971c5c6690","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c7a1dcf720e67229749c18693de6bb00a9397fd69a442287be04552f149a9d48","observation_id":"b798b39f-f1cb-4a07-ac61-8bb432033b83","resolution":{"observed_at":"2026-05-26T01:11:28.066015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"171b0766-c348-4271-9174-fb32516d6218","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:26174ba031a1f1b15fbb7e86f22be4452566edd35edd20060eb1b6558f145406","observation_id":"9f62d578-e692-4254-a244-6c6439552d51","resolution":{"observed_at":"2026-05-26T01:11:28.015182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finetuning Pretrained Transformers into RNN s","venue":null,"work_id":"b25df6a1-c531-4d81-9d64-3fb7b12c07fb","year":2021},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:404b1c5ca7b449afc988ca0d85fc94d0dfa73de7525cac24e3cf33bf71bc9ac9","observation_id":"16780a74-8bf3-42bd-84d9-713c9905980a","resolution":{"observed_at":"2026-05-26T01:11:28.010692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":"2307.08621","doi":"10.48550/arxiv.2307.08621","metadata_source":"pith","pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","venue":"cs.CL","work_id":"5b0449ac-92b0-41f2-8b4f-586c2b5a08b6","year":2023},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:e8ab96cfbf83faf488bf3759d96e50cde0040f96542827547a15bb6a5cdf2f2b","observation_id":"e3aa6de8-f336-42fb-bb5c-c7506f79503c","resolution":{"observed_at":"2026-05-11T20:30:00.053340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"045015e8-e122-4118-b960-8c63308a0811","year":2021},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:fb3b26ab316e699d6c91767e3b7cf8f864ef3879332e0eefb27fb8688dd59581","observation_id":"fde5b0ab-107c-4c82-976f-82f4c47ae033","resolution":{"observed_at":"2026-05-26T01:11:28.019497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"3c0723c0-bea8-4ec0-9119-fe7747950912","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:069e9be5c258de5bd1232ac418b088b4c8431adcb1b035156647004a854de215","observation_id":"9daffe10-7da8-4127-abec-5bec88657a45","resolution":{"observed_at":"2026-05-26T01:11:28.027600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:b4da8f5c84ef8070f1229e06a98ad6b5c90c8221db15549370be81c557af2524","observation_id":"826d8c55-c425-4196-8de9-e26fa2671c05","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"2a4e6797-1892-4de8-ac00-939fc193a250","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:d8b31c2c03d991d71bcd9dee5895618782a1a35c64d2a3b72078bf8645469299","observation_id":"beebc420-c7a8-46fc-91ae-78bec2f54769","resolution":{"observed_at":"2026-05-26T01:11:27.999028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"3db964a4-6a6a-4e51-a425-1677e524cb3b","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:2d21511be13ec692bd2311b042f5df37310162cd81468280cd6008ddcbdbe96a","observation_id":"a4683146-9cb5-4d34-aae7-001854d8a2ce","resolution":{"observed_at":"2026-05-26T01:11:27.987223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06577","last_updated":"2025-05-17T06:34:17Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T06:22:36Z","title":"Rodimus*: Breaking the Accuracy-Efficiency Trade-Off with Efficient Attentions","version":2},"cited_work":{"arxiv_id":"2410.06577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06577","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhihao He, Hang Yu, Zi Gong, Shizhan Liu, Jianguo Li, and Weiyao Lin","venue":null,"work_id":"48f86e54-4ecf-4e53-b809-6559237f72bf","year":2022},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2410.06577","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c192da8accbf7248a556f9f11f4aa845284d65ee3e7d861b7604c3b53ebdae88","observation_id":"ed9f019a-b2eb-4bb3-89ff-62942f95e516","resolution":{"observed_at":"2026-05-11T16:41:10.966030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01578","last_updated":"2025-08-08T18:42:33Z","snapshot_observed_at":"2026-08-03T06:05:28.352853Z","submitted_at":"2025-02-03T18:03:13Z","title":"ReGLA: Refining Gated Linear Attention","version":3},"cited_work":{"arxiv_id":"2502.01578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01578","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.01578 , year=","venue":null,"work_id":"2e916303-24f4-46e5-9339-ff05ac23ab35","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2502.01578","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:5f80152c3ff09f933f0c9c0ce8212ff8051ab9e9b17b1b2d70e8ec23e87c7001","observation_id":"e588fc1d-a70d-4b1a-a4d4-d26bcdc64ce0","resolution":{"observed_at":"2026-05-11T16:41:11.049805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"80f85b6e-0f5e-4f0e-9221-702dfbd1549c","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:bb4d10a1eeaf9d001f7208664a7abf48d63ebcf82a66d1089103b1e5e548e1d2","observation_id":"7448f5be-642f-488d-9b27-84128a31274f","resolution":{"observed_at":"2026-05-26T01:11:27.983028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d7e0617a-72eb-4da4-8242-8847cc08dcf8","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:6fc807b56032c1bf9aa7fb26a13ff6dce2aa2bf556935b97709df317c185ad4b","observation_id":"905ea5ee-242d-40f4-a34f-58910aa3bb54","resolution":{"observed_at":"2026-05-26T01:11:27.990987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Transactions on Mathematical Software (TOMS) , volume=","venue":null,"work_id":"e95dfd71-c8c1-47a2-8646-32add81d096d","year":2006},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:fe17bd921d2a40b5dc7d1a5f00c6aaef84d1fe3fb80ecd793bbb8cfb3145fb49","observation_id":"48d43cc8-ffec-4603-aac6-b5ce1bf58c9c","resolution":{"observed_at":"2026-05-26T01:11:28.002816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Loan, Charles Van , booktitle =","venue":null,"work_id":"b338e595-f33f-4c5f-8709-c5362bba8e26","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:eed8eb36f1413b2971051197348fc56e98edee255666bd89d3ab59c335ae70e6","observation_id":"91bf4517-7298-4b2a-9431-a78cc8eb84cb","resolution":{"observed_at":"2026-05-26T01:11:28.031468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12602","last_updated":"2026-05-08T15:47:57Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T08:51:02Z","title":"Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics","version":4},"cited_work":{"arxiv_id":"2512.12602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.12602","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics","venue":"cs.LG","work_id":"589ce737-ecd5-4de0-a844-51344df81548","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2512.12602","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:9621dc458e17fb5ababba5512abfe62937b5c536d29dd5b387f57f1e9d3365d9","observation_id":"a9081fb3-8807-4616-a8ff-93745cbe6af2","resolution":{"observed_at":"2026-05-11T16:41:11.556727Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:57:34.236379Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"a1fd09f1-b62b-4aca-a5ef-dd2b50ad08b5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c8168b9b57db990e854b3a428be14a7a8981af6148ccbbad6f48504d3ed4eed5","observation_id":"9eb703ac-3951-4795-ae05-fde439c71f30","resolution":{"observed_at":"2026-05-26T01:11:28.073542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.775981Z","title":"2025 , eprint=","venue":null,"work_id":"26c7b6ed-f86e-4ed8-b9ed-b1783d90255b","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:343bec437f21a4f80a4f9a9067cf5287dfdee12c1a0876de83635753c2f3e5bc","observation_id":"969179a5-8156-4d73-9975-1447d28294ba","resolution":{"observed_at":"2026-05-26T01:11:28.102058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.072369Z","title":"2025 , eprint=","venue":null,"work_id":"48433903-69b6-488e-8671-0068c3d3c44f","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c0198412e2f0db8e394f1c4b9b15ae27c7bbd3b2b75e05a921ba4ce69c79f7e1","observation_id":"9b7051c3-e22c-4e13-ad5e-d68c826032f6","resolution":{"observed_at":"2026-05-26T01:11:27.967746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Workshop on Efficient Systems for Foundation Models II@ ICML2024 , year=","venue":null,"work_id":"5a7d45df-0f93-4a14-a10c-7ba0a4230574","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:01bacd416bcf180e920f4c128a0e66c33eb4340e344896331be652084f9e0205","observation_id":"97e8ae48-12fb-4d97-9b3d-b6796c6ac90d","resolution":{"observed_at":"2026-05-26T01:11:27.971742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"77929aa0-e56b-43bd-a602-e5ac11a5967e","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c9ca2a07929ae1e2f89150661be02338e67250d39f516558c48a23a8686009e6","observation_id":"ca54c31c-d446-4d9b-9fb7-667d6fdb671d","resolution":{"observed_at":"2026-05-26T01:11:27.975400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distill , year =","venue":null,"work_id":"e7194131-2a57-4015-ba7f-0c4bf3fd5d4e","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:933bca4674d8059906bb82e9532a6a1b99548246bc447024907a0440650e3dcc","observation_id":"9049de91-aff1-4fbf-8a89-0a46939dd6b8","resolution":{"observed_at":"2026-05-26T01:11:27.963660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlocking State-Tracking in Linear","venue":null,"work_id":"cce4ab93-8ab7-4242-9a7a-9aff471e8a8e","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:d53fcb9e6faba2b477021f6ea875760725f12bab13c0ae2558fedbef065808f2","observation_id":"debe76c3-336b-4877-99a7-68fe32e450e3","resolution":{"observed_at":"2026-05-26T01:11:27.959542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeltaProduct: Improving State-Tracking in Linear","venue":null,"work_id":"acb8aa35-b945-4deb-9ce1-6d0a43c91edb","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:ea97ac5df2dff537089014b3b8f01540fd5b7ba57ce9c753c379e125057b75b0","observation_id":"0a73f934-81e4-4b30-b602-10c4cd35b68c","resolution":{"observed_at":"2026-05-26T01:11:27.955375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f8902797-e2dc-4846-8147-af673d21d7f5","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:5ff925f84b231fabf68c9513381c1a29be8adf1c2af1c1bbcfdbaddc56923188","observation_id":"d53d4e46-6c1a-4ed4-a84b-1cebf5f47038","resolution":{"observed_at":"2026-05-26T01:11:27.979339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:46:13.315545Z","title":"Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":"f6ab31a8-e607-40f9-89b2-cb251b41df33","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:022f7e513483fb80c43d96022a76c0e36caf52cd0245599cc3547734e1a5725c","observation_id":"7e18544a-7836-4d50-85c1-2994d9b34ba0","resolution":{"observed_at":"2026-05-26T01:11:28.106236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:441c0bb35ed14c07d8a3ac0d1e4a869f5f1b4bd48738f02485a87da108bab269","observation_id":"55dcb398-add9-4c41-9f4b-98cb451f8a15","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.15884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.450397Z","title":"Jet-nemotron: Efficient language model with post neural architecture search","venue":null,"work_id":"ce920786-ab4a-4858-a933-0637bfc7b2f9","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:f1d0de9b73a522c6cb6bc04c23606dd02ccbe298134b18a2b88b652186f78062","observation_id":"040c1aa2-9a6d-41bf-a81c-b1d5b4c4a334","resolution":{"observed_at":"2026-05-11T16:41:12.019849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:956fa54374490e90aaa3eec198ac422c98047bdd4220442a5c002d10e4f1d64b","observation_id":"36da2f7c-0c4e-46fd-96cf-689704528220","resolution":{"observed_at":"2026-05-11T16:41:11.056112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":"2403.19887","doi":"10.48550/arxiv.2403.19887","metadata_source":"pith","pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","venue":"cs.CL","work_id":"129df0fe-8a66-4077-8991-3557cfa38274","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:cbfad0f4b65418b4dfd165633ca9e6e607087b10dce8c0aec30f04214429f294","observation_id":"520a7277-b1b9-4a11-95f3-a3851eb2b03d","resolution":{"observed_at":"2026-05-13T14:11:27.316872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"9024e9d5-b9ee-4db6-b6ae-cfe9489f5479","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:3a9312f7da3978b88c6b86e070e58e5f26578b9c698b5fd7a35c358be6b5dfeb","observation_id":"df6c348f-16fb-4577-a498-cb6059886a26","resolution":{"observed_at":"2026-05-26T01:11:27.939246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 30th International Conference on Machine Learning , pages =","venue":null,"work_id":"a3f9e282-0430-4497-a345-f0e5d82a25dd","year":2013},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:0e89c26ab744644fbc3e10aa5b7ac66c19dfa074c4707b0677d6cbe6f80900d7","observation_id":"978cdf63-6777-4d5e-b246-c5afd9a946b3","resolution":{"observed_at":"2026-05-26T01:11:27.947336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dokl akad nauk Sssr , volume=","venue":null,"work_id":"8db2587d-09a8-42c7-928b-d178d812e2b2","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c48ebadd42e51fbefc7a8c997932d6248ee394215ccbf66334c15b4165b9d572","observation_id":"a88a3b24-d2e5-4268-9029-8ad21f0325b2","resolution":{"observed_at":"2026-05-26T01:11:27.922748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1987 , publisher=","venue":null,"work_id":"e83b57c7-135a-4169-95c5-b6fd2d2ad77b","year":1987},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:c1f7161693964b979769e8d78edba66099bdae3b1acd049a66ac85c77b6e95a1","observation_id":"a98676c2-4e38-46db-9a31-8a85688e76a3","resolution":{"observed_at":"2026-05-26T01:11:27.914767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18510","last_updated":"2024-12-06T19:50:34Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T17:38:06Z","title":"RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval","version":4},"cited_work":{"arxiv_id":"2402.18510","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.18510","snapshot_observed_at":"2026-07-10T01:36:44.296965Z","title":"RNNs are not transformers (yet): The key bottleneck on in-context retrieval","venue":"cs.LG","work_id":"55ea4c0e-dff9-4216-af85-d89726fca9f2","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2402.18510","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:71fc4aed8df286b115a2d341d7b5624fb11cd5b00fa9643b1d9a8a30b6645dd1","observation_id":"22743032-aca1-4fb4-8ab7-4365b574de4b","resolution":{"observed_at":"2026-05-11T16:41:12.031207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12352","last_updated":"2025-05-02T02:07:05Z","snapshot_observed_at":"2026-08-04T07:06:28.042736Z","submitted_at":"2025-01-21T18:32:31Z","title":"Test-time regression: a unifying framework for designing sequence models with associative memory","version":3},"cited_work":{"arxiv_id":"2501.12352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12352","snapshot_observed_at":"2026-07-04T19:30:07.279614Z","title":"Test- time regression: a unifying framework for designing se- quence models with associative memory","venue":null,"work_id":"cd562ae0-3a25-440b-897c-54d66eb3d6ff","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2501.12352","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:9a6187e50ef3d427862db0f856db036a13936e2c0d2112031a4ff691eb5ed5b4","observation_id":"805150bc-6ca5-412d-b6d7-419f0d7733b8","resolution":{"observed_at":"2026-05-11T16:41:11.016309Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19488","last_updated":"2025-05-26T04:15:38Z","snapshot_observed_at":"2026-07-06T21:30:18.842268Z","submitted_at":"2025-05-26T04:15:38Z","title":"Understanding Transformer from the Perspective of Associative Memory","version":1},"cited_work":{"arxiv_id":"2505.19488","doi":"10.48550/arxiv.2505.19488","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19488","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding transformer from the perspective of as- sociative memory","venue":"ArXiv.org","work_id":"8203bff0-8a75-42c5-8c22-aa67ec7e6cf1","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2505.19488","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:63b9a0052319c6cba72c13d62382a7f383a247891f436bd8978985196e930e35","observation_id":"319df3c7-82a0-4bef-846f-2a325020f2b7","resolution":{"observed_at":"2026-05-11T16:41:11.992338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"58878865-6381-4e38-a463-cafa3ac71269","year":2023},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:92cac10d86867c9256c6b094559cf67b6ed539631a9903c75cc47dd683b13e77","observation_id":"b2c02809-6362-49ea-bba8-c0ba4c8b8b8f","resolution":{"observed_at":"2026-05-26T01:11:27.918696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Artificial Intelligence and Statistics , pages=","venue":null,"work_id":"3811abbb-b85a-4939-ab77-d776e0d08eb4","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:283c15b4c96ae0a8d64f10ccd02488ebe005004401725478fca2282a79d22947","observation_id":"0090beba-5ccc-490e-b5c8-e8b32be32927","resolution":{"observed_at":"2026-05-26T01:11:27.926652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:238f3a884400ad6a1b675979199cb7786f1cebbdbf4e970da52e31d89f5f6332","observation_id":"f2ad88e8-9dda-4a0d-9b17-51c4c18680e6","resolution":{"observed_at":"2026-05-11T16:41:11.794179Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"7d704231-3ecc-436f-ba59-07037f428b3e","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:60c49c905b4e005e3958f5bad50ac19d0f011b8a0e3e234fb4a18b303d45029c","observation_id":"9521c33c-7ac2-4070-ab7e-0bf3a04c7fb7","resolution":{"observed_at":"2026-05-26T01:11:27.931032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.804512Z","title":"Log-linear attention","venue":null,"work_id":"9c67d35a-c055-4f41-862f-308bd2e3e832","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:429327b47e087fa03c370f9c3bcd13ee0291abcad50ec07e77125ec2f8e69dd0","observation_id":"33dea766-2e8e-4830-97f3-7154a2b7f7e8","resolution":{"observed_at":"2026-05-11T16:41:12.003990Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International journal of neural systems , volume=","venue":null,"work_id":"da4b44e8-b9c5-4168-ba81-f93863d8b387","year":1989},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:5ac2df3b9889c8ebfd5f305edbd26550dce1082d167dd5a152745829b554ac7e","observation_id":"7bea520c-7c1d-4231-9282-bdd65671e3c3","resolution":{"observed_at":"2026-05-26T01:11:27.943141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14207","last_updated":"2024-10-02T14:32:59Z","snapshot_observed_at":"2026-08-04T14:58:56.675148Z","submitted_at":"2024-07-19T11:12:08Z","title":"Longhorn: State Space Models are Amortized Online Learners","version":5},"cited_work":{"arxiv_id":"2407.14207","doi":"10.48550/arxiv.2407.14207","metadata_source":"pith","pith_arxiv_id":"2407.14207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hanxiao Liu, Zihang Dai, David R","venue":"cs.LG","work_id":"854578cf-e114-4bac-998f-a9ee9f8c7dc2","year":2024},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2407.14207","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:92ec226781c582751c6f509a113ab3fde615b0d17149e7bd5121cbdd58d16972","observation_id":"23f71ab0-9b25-4b89-83d4-11c983a2377d","resolution":{"observed_at":"2026-05-11T16:41:11.304677Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"92aefe4c-c5f7-4a03-9b01-ecfebe2cd11a","year":2019},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:8538dc991fb1d54deff83fb526d7646ad370b15579665c2f83f7d0fe75c7f0a1","observation_id":"00ccdcdd-9009-4484-8965-4225a7f6bcfe","resolution":{"observed_at":"2026-05-26T01:11:27.898611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":"1606.05250","doi":"10.48550/arxiv.1606.05250","metadata_source":"pith","pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","venue":"cs.CL","work_id":"0492dd16-26e8-48d9-874c-3dd90cae7b85","year":2016},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:fbee5e9bea788f856ea7bc9d180166d5029636cd4ffa420aa492283bd4f2d44e","observation_id":"92fc2e43-841d-422e-b39d-6c7de4ad3c21","resolution":{"observed_at":"2026-05-12T10:13:01.811276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09433","last_updated":"2025-03-07T17:33:50Z","snapshot_observed_at":"2026-08-04T09:23:49.784725Z","submitted_at":"2023-04-19T06:00:26Z","title":"Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes","version":3},"cited_work":{"arxiv_id":"2304.09433","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09433","snapshot_observed_at":"2026-07-04T00:59:20.044507Z","title":"Language models enable simple systems for gen- erating structured views of heterogeneous data lakes","venue":null,"work_id":"c959d8fb-c98f-4998-9884-dfa66742091d","year":2023},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2304.09433","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:57b3c44655cb459732cc97897bf5f9aa965c61984a77b749faa845b0e849b066","observation_id":"c998ee59-aab9-4449-b159-00e04a6478d5","resolution":{"observed_at":"2026-05-11T16:41:12.028244Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern recognition , pages=","venue":null,"work_id":"4cb58831-517d-4106-bbaf-81a0f8cd7d69","year":null},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:531d91e233dd06a90e26c0841b2fa7057e4300b366167ad6a37cb894aed2b223","observation_id":"ddce6137-a5bd-46d3-8ed2-aa08db956a5f","resolution":{"observed_at":"2026-05-26T01:11:27.894598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.928371Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"7ffb0a42-d4b0-4a4d-9507-e85319b86fcf","year":2019},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:ecb4305b94bf9191a01b4f1ce2b124951816afdf76fa4215aac295d5851899be","observation_id":"16abfcfc-f1db-4e06-8aa1-74ccef56a446","resolution":{"observed_at":"2026-05-26T01:11:27.902791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":"1903.00161","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-07-09T12:46:14.545000Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","venue":"cs.CL","work_id":"074eb9b5-e9c6-4075-8dcb-0e4c103924c1","year":2019},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:5edb678f03bce5f22139a001e3d72df6a52ff54c39e3cd357df16da67842195c","observation_id":"67e31863-83c4-4b8f-8af5-53847beaac56","resolution":{"observed_at":"2026-05-11T16:41:11.031334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Survey on Large Language Model Acceleration based on","venue":null,"work_id":"00a92162-2bec-4e94-9d2b-5749fe1bfb53","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:b78c81c784aa4eaba5b9abe3377bf2d3963565b7ac268f72b7fa9c276644aac0","observation_id":"5e63c68c-efa2-4d2b-959d-15d11e215048","resolution":{"observed_at":"2026-05-26T01:11:27.890598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:2e969ba46b1ca77930a2b13b607136f289f1b8447621f8c8cbda42192e2448fa","observation_id":"f1bafc29-79a4-4fea-83ef-1a532689648b","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":33,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":59},"total_outbound_references":117},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 117 outbound references and 0 inbound Pith citation observations for arXiv:2605.05838."}