{"as_of":"2026-08-10T04:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1aadbc0d475074678ca1f5774e619ef03011ea24a11d55f94a6e6d1ec8811ac","coverage":[{"denominator":200,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:58:58.867835Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:52:15.202629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:09:36.811786Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"cited_work":{"arxiv_id":"2502.00197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00197","snapshot_observed_at":"2026-07-04T06:09:36.811786Z","title":"Chang and Y","venue":null,"work_id":"efa4d93c-f6dc-4ba5-86b4-fb2f1c0914f6","year":2025},"citing_paper":{"arxiv_id":"2606.20999","last_updated":"2026-06-19T00:19:53Z","snapshot_observed_at":"2026-08-02T02:39:42.396834Z","submitted_at":"2026-06-19T00:19:53Z","title":"Inductive Generalization for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:52:15.202629Z"},"links":{"cited_paper":"/paper/2502.00197","citing_paper":"/paper/2606.20999"},"observation_digest":"sha256:0c6d68e7bb8c007718a97ac77a8a1466d787318d76a4315e2c940f8e49c5b042","observation_id":"d02f66f3-a884-46ee-8809-ccd0a4dc5335","resolution":{"observed_at":"2026-07-04T06:09:36.813232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00197/citation-record","integrity":"/paper/2502.00197/integrity","json":"/paper/2502.00197/citation-record.json","paper":"/paper/2502.00197"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.532496Z","title":"Generalization on the unseen, logic reasoning and degree curriculum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.532496Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:20663174b8145b61602f41fdb3876a732e0a63f4662033b62b017a3d326f7aef","observation_id":"6aa04dd3-1356-4934-97b8-6caaf6d5630c","resolution":{"observed_at":"2026-08-09T19:58:58.532496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06467","last_updated":"2024-11-01T17:45:03Z","snapshot_observed_at":"2026-08-04T15:01:32.494745Z","submitted_at":"2024-06-10T17:05:12Z","title":"How Far Can Transformers Reason? The Globality Barrier and Inductive Scratchpad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06467","snapshot_observed_at":"2026-08-09T19:58:58.536622Z","title":"How far can transformers reason? the locality barrier and inductive scratchpad","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.536622Z"},"links":{"cited_paper":"/paper/2406.06467","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:c33778111e494afb41dc7cf8cff8294c12373a27fab27aebc741b471fcd76e96","observation_id":"41075264-72e6-4f6b-88c6-d017d13d2f59","resolution":{"observed_at":"2026-08-09T19:58:58.536622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.540760Z","title":"and Mansouri, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.540760Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:032a1d752277e329324efaef8358faa135ac8a58c983e2b38a596d668bd27792","observation_id":"bc794514-7c94-4ff6-8a9f-9d7ccefae7bc","resolution":{"observed_at":"2026-08-09T19:58:58.540760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.544307Z","title":"and Rodríguez, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.544307Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:45af063de11bc1211a22fd1096311b125af5ded23b323e8563812971c5abee4e","observation_id":"7600bbd7-3cb1-4dd4-b536-a947b8223bdf","resolution":{"observed_at":"2026-08-09T19:58:58.544307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.547602Z","title":"Autoregressive transformers are zero-shot video imitators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.547602Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:0cd46495dcc1b64db55838c3e9435e41b9d9b6b94c827bbd74d4d91d5830cd90","observation_id":"3e64211c-5dd5-455e-91b2-75785a820dd7","resolution":{"observed_at":"2026-08-09T19:58:58.547602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02893","last_updated":"2020-03-27T19:07:58Z","snapshot_observed_at":"2026-07-06T08:05:24.076802Z","submitted_at":"2019-07-05T15:26:26Z","title":"Invariant Risk Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02893","snapshot_observed_at":"2026-08-09T19:58:58.550955Z","title":"Invariant risk minimization","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.550955Z"},"links":{"cited_paper":"/paper/1907.02893","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:3ea6a2a52b9bd8e565deb32c8f3400d766bdaee94e095b83862e16324fae49a5","observation_id":"88536657-7b6a-413f-930e-4459c69080b9","resolution":{"observed_at":"2026-08-09T19:58:58.550955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.554851Z","title":"Dynamic node creation in backpropagation networks","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.554851Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:7839e2ab1029154b9543630c2564f40712e62c308dc3841a555463609aeef2e1","observation_id":"588d85eb-f1c3-483b-9222-d920715f5314","resolution":{"observed_at":"2026-08-09T19:58:58.554851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.558638Z","title":"and Nagarajan, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.558638Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:3d3a3e5452c6787cb93bc254b3e51f35f28ba65a6cc045d29fec83f02cb1b279","observation_id":"2e3dfbbe-d01a-4be0-b184-6f0cf9557af7","resolution":{"observed_at":"2026-08-09T19:58:58.558638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.561859Z","title":"P., Köster, R., Chadwick, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.561859Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:fd99257ba9bd0f5129b459a42851c18d17c231b757e20d4967fc5d75b7f41a78","observation_id":"6b4ea1c4-9aa0-4d42-8f5d-1661b9fa117b","resolution":{"observed_at":"2026-08-09T19:58:58.561859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.564897Z","title":"Pondernet: Learning to ponder","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.564897Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f1dfffbbbf47e70ebe10110d798513bc6cb877725247368fa184d185bff1839e","observation_id":"28b05043-23fb-4e42-abe7-e7e7250b5809","resolution":{"observed_at":"2026-08-09T19:58:58.564897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.567977Z","title":"L., Montanari, A., and Rakhlin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.567977Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:953c767acd228f70ec810595c57eaf8570acfc90510afbc6b23dfc7606ed0b3b","observation_id":"3141a23b-a5cc-47c5-9a4e-e923389a24de","resolution":{"observed_at":"2026-08-09T19:58:58.567977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.570976Z","title":"A model of inductive bias learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.570976Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a4395ca0322197dc4efa23e0d3e35c3bb96f54234080910b352a3296c9c30bca","observation_id":"2540d0ac-c56c-4136-a5d1-52f553efdc1c","resolution":{"observed_at":"2026-08-09T19:58:58.570976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.574038Z","title":"and Schuller, R","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.574038Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f0f2b5dd01ab29c88e2782c643d1d998321930d87a43734ee996bde7194c49b5","observation_id":"c8e929f7-7d09-4436-a1cb-6e2850612ebb","resolution":{"observed_at":"2026-08-09T19:58:58.574038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.577056Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.577056Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:35766f14c77eadb1f0bc9a194b0b3f6750a3d761e4c5657a5ddb6b2e1ca0b9a4","observation_id":"ab0f2012-f1a2-41cf-b990-bc756decc577","resolution":{"observed_at":"2026-08-09T19:58:58.577056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.579961Z","title":"and Boult, T","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.579961Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:62cdc25f814fa2b44cb5991cc61ec2bb2f01eae696140304f383964bd4dde783","observation_id":"afdc4092-f724-4c70-a546-a1de8e721af5","resolution":{"observed_at":"2026-08-09T19:58:58.579961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.583995Z","title":"Deep learning of representations for unsupervised and transfer learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.583995Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:dec5124d8cc554221de83185e4f7098961ecdcf8f90b305b981c0bbd18a4cb30","observation_id":"9ce5e554-f15a-4d99-8906-69ad4421da0f","resolution":{"observed_at":"2026-08-09T19:58:58.583995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.587083Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.587083Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:b3912135edc4602a33f5596e1792f45b6b021f8f722ecc21f60623cc23dc9931","observation_id":"1fc7285a-80cb-47c2-807c-0654b133cbba","resolution":{"observed_at":"2026-08-09T19:58:58.587083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.590327Z","title":"On the practical ability of recurrent neural networks to recognize hierarchical languages","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.590327Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5efc7ba5da1506175ed59e6c3ca6d28b1842e0b9eb2fc2c3a2eafea993420caa","observation_id":"1561931f-2784-4b30-999d-34db768e0e58","resolution":{"observed_at":"2026-08-09T19:58:58.590327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.593567Z","title":"On the Ability and Limitations of Transformers to Recognize Formal Languages","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.593567Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:89f4095fa93d96e947e9a6a876e0a9898f39fa05e02b19eb5fb34f002bc46883","observation_id":"b6e6d241-e002-4673-af37-a39711694993","resolution":{"observed_at":"2026-08-09T19:58:58.593567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.596605Z","title":"Simplicity bias in transformers and their ability to learn sparse Boolean functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.596605Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2b4e0a17a756b143b9ecf228167dbc9c69a567d85ae01069abef8b537ed7051e","observation_id":"e0cc7456-c94b-4aef-ad38-00a05bd9d6e7","resolution":{"observed_at":"2026-08-09T19:58:58.596605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.599725Z","title":"and Schulz, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.599725Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d7c9535d42993f53807ac37801fbc9ee25e9ef6f2df857dc16c69efba75512e9","observation_id":"a372cc28-8fe7-430a-b55a-fb58d59d0788","resolution":{"observed_at":"2026-08-09T19:58:58.599725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.602830Z","title":"E., Cruz, S., Dhamija, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.602830Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5ec8e2fe7badf83cf9dcc6790568ab8e523530d6a2cd66a192abd395ebf7a1ca","observation_id":"9ddd2113-7a27-43f4-8f5f-44a45a692e04","resolution":{"observed_at":"2026-08-09T19:58:58.602830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06611","last_updated":"2017-04-21T16:02:26Z","snapshot_observed_at":"2026-07-06T05:38:45.250998Z","submitted_at":"2017-04-21T16:02:26Z","title":"Making Neural Programming Architectures Generalize via Recursion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06611","snapshot_observed_at":"2026-08-09T19:58:58.605979Z","title":"Making neural programming architectures generalize via recursion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.605979Z"},"links":{"cited_paper":"/paper/1704.06611","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:0ed878ea27fc5d4a3e976b5074639eef1ee7fdb69bc878886491dc26e97d57cd","observation_id":"731e7264-b6dd-4eeb-9f45-021db20ddef4","resolution":{"observed_at":"2026-08-09T19:58:58.605979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.609671Z","title":"Précis of the origin of concepts","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.609671Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2f763d9d7e01daf1708a5bbc49436ec286f55d5fcce8ceeab4b94b063d7a7e1c","observation_id":"dc5b9a19-f900-40d1-9176-8059e0aeb7f3","resolution":{"observed_at":"2026-08-09T19:58:58.609671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.612717Z","title":"Multitask learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.612717Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:26bcf4a9e3003fb4f588645ff26d1bc6fafdd513e958e6d6af1313fa9e8fe087","observation_id":"35f20f8d-ac1f-49a0-9223-b9f0fdeae851","resolution":{"observed_at":"2026-08-09T19:58:58.612717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20131","last_updated":"2024-10-25T14:50:45Z","snapshot_observed_at":"2026-08-01T18:24:13.057707Z","submitted_at":"2024-05-30T15:10:37Z","title":"Language Models Need Inductive Biases to Count Inductively","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20131","snapshot_observed_at":"2026-08-09T19:58:58.615900Z","title":"and Bisk, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.615900Z"},"links":{"cited_paper":"/paper/2405.20131","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5ef26506f2c6c16e670c6997e1e52107b45d0c89a2ac651fe095421964b2c512","observation_id":"1765ed43-296b-4381-9305-6828726aaa28","resolution":{"observed_at":"2026-08-09T19:58:58.615900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.619239Z","title":"A convex formulation for learning shared structures from multiple tasks","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.619239Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d75c13b3a985430a91806901fc125e4d51cef4ad701f8b76dcad5e32213e35c1","observation_id":"739a501a-3bc1-4268-9043-08bc1c1aec3c","resolution":{"observed_at":"2026-08-09T19:58:58.619239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08477","last_updated":"2024-07-01T15:29:16Z","snapshot_observed_at":"2026-08-06T17:45:57.639013Z","submitted_at":"2024-03-13T12:46:03Z","title":"Unleashing the Power of Meta-tuning for Few-shot Generalization Through Sparse Interpolated Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08477","snapshot_observed_at":"2026-08-09T19:58:58.622270Z","title":"W., Schwarz, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.622270Z"},"links":{"cited_paper":"/paper/2403.08477","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:55d376b81902a21ea5a8c63212a608605b486cd91f33e7d6d2a3aa7c72fa5c92","observation_id":"6a9a48b6-57a0-49fd-ba10-7b75351bb3a7","resolution":{"observed_at":"2026-08-09T19:58:58.622270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.625828Z","title":"and Liu, B","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.625828Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9f4380c5635d169bfa063391d890fae59f776d93e7f5d68ca4120845beef413a","observation_id":"580f9c21-5e89-4a6c-a327-17af3ce4afc9","resolution":{"observed_at":"2026-08-09T19:58:58.625828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.628817Z","title":"Learning from multiple sources","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.628817Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e2b53f4cde852e59dd2790f7b7cf5e662dd7a762882703c1d682b8db7cdf90d7","observation_id":"cee00724-6292-4152-8583-45105c15490d","resolution":{"observed_at":"2026-08-09T19:58:58.628817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.631911Z","title":"Learning higher-order logic programs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.631911Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:29c81e2cfcb03bac4a3feee1a227cb6fd741f9491a69af278aa13bfbd867eadb","observation_id":"a6ddfcdf-fc35-40f4-8c83-aa18aafde7d1","resolution":{"observed_at":"2026-08-09T19:58:58.631911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.635110Z","title":"and Feys, R","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.635110Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e778619aa95383f5308df1f1a3f99cb6ab2ccdb2631586f3899a2efeeef069b2","observation_id":"7225f957-2c7b-4f9e-a455-56ca6abc7468","resolution":{"observed_at":"2026-08-09T19:58:58.635110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.638190Z","title":"Bayesian multitask learning with latent hierarchies","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.638190Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f5cfd0520353f793efdb92858ace93b6343fb600a89fe0774c415b156d93109d","observation_id":"dd7695cd-4d73-4216-930b-c7ea771bc89c","resolution":{"observed_at":"2026-08-09T19:58:58.638190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.641165Z","title":"B., Lu, T., Luu, T., and Pál, D","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.641165Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:274986d0927bc655551579a32f88a19fc12cf049dfd779fca683dd140d813016","observation_id":"cb2bff39-dbd6-4f0e-9418-c315ea5b3622","resolution":{"observed_at":"2026-08-09T19:58:58.641165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01686","last_updated":"2025-06-09T18:05:35Z","snapshot_observed_at":"2026-07-06T19:26:12.102947Z","submitted_at":"2024-10-02T15:55:08Z","title":"Positional Attention: Expressivity and Learnability of Algorithmic Computation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01686","snapshot_observed_at":"2026-08-09T19:58:58.644090Z","title":"B., Giapitzakis, G., Yang, S., Veli ˇckovi´c, P., and Fountoulakis, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.644090Z"},"links":{"cited_paper":"/paper/2410.01686","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d54c2eea3432f844acd77f75a73fdb7547b8fe6ab7efe0b746b9a110bda0d217","observation_id":"2cdd0f68-d1d3-4e0e-80aa-fbb474b95451","resolution":{"observed_at":"2026-08-09T19:58:58.644090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.647514Z","title":"Random deep neural networks are biased towards simple functions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.647514Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:060c07a54562075d23869fbe449567930a17ea40eec8ce31245a0ed63cb90f59","observation_id":"5c1fdd9d-740e-4e47-a20a-1b5f5c3cb499","resolution":{"observed_at":"2026-08-09T19:58:58.647514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.650534Z","title":"H., Cowan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.650534Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:45059197a2dc467db4290702bff9f4daafe4da312838ae47bd6742b91fb3ca82","observation_id":"48562429-90ed-4751-b471-5b428a45e473","resolution":{"observed_at":"2026-08-09T19:58:58.650534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.653505Z","title":"Universal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.653505Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:7b1a29621f15eb9e32b4b4d8a4706f9c7091c79e7936b861344ed26fa5e1fb76","observation_id":"d42f2003-10e6-4a22-adfb-03ee0f211182","resolution":{"observed_at":"2026-08-09T19:58:58.653505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.656387Z","title":"K., Catt, E., Cundy, C., Hutter, M., Legg, S., Veness, J., and Ortega, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.656387Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:cee5a6bf64de679c4dca45369cb34789650194545a0550a7d545f64164717846","observation_id":"389655e0-3b77-4a57-9b35-f162e088c76a","resolution":{"observed_at":"2026-08-09T19:58:58.656387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14501","last_updated":"2024-06-07T17:24:36Z","snapshot_observed_at":"2026-08-04T14:24:56.404829Z","submitted_at":"2021-09-29T15:35:16Z","title":"Towards a theory of out-of-distribution learning","version":5},"cited_work":{"arxiv_id":"2109.14501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.14501","snapshot_observed_at":"2026-08-09T19:59:00.086331Z","title":"Towards a theory of out-of-distribution learning","venue":"stat.ML","work_id":"c37f6c6e-8751-46c3-9bc6-7d41cfbb53cd","year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.659419Z"},"links":{"cited_paper":"/paper/2109.14501","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:95f19c93d3db5a9b94304665a8a1302a0b99b7aac535ecaf70695e64992cc74c","observation_id":"28069940-5170-4b81-bc85-290cfead5e45","resolution":{"observed_at":"2026-08-09T19:59:00.090318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.662538Z","title":"A closer look at distribution shifts and out-of-distribution generalization on graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.662538Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:50156b996f6e2cf473a67e473853554596548454e83225af66b6ab455e865d75","observation_id":"b65e1763-5466-414f-875e-71f700e31f0a","resolution":{"observed_at":"2026-08-09T19:58:58.662538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11719","last_updated":"2022-12-01T14:47:50Z","snapshot_observed_at":"2026-07-06T14:21:22.601555Z","submitted_at":"2022-11-21T18:41:19Z","title":"First Steps Toward Understanding the Extrapolation of Nonlinear Models to Unseen Domains","version":2},"cited_work":{"arxiv_id":"2211.11719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11719","snapshot_observed_at":"2026-08-09T19:59:00.070467Z","title":"First Steps Toward Understanding the Extrapolation of Nonlinear Models to Unseen Domains","venue":"cs.LG","work_id":"ddec6dbe-7df8-44c9-83ed-7777d9feb0a5","year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.665308Z"},"links":{"cited_paper":"/paper/2211.11719","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:bd0171f5d7fad145dfccd5b0cc2fe2b6894f08ba400cb4c26b67edd4685000b8","observation_id":"08eddf54-d707-4587-a3a9-4da33b5ceb3a","resolution":{"observed_at":"2026-08-09T19:59:00.074951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.668701Z","title":"Location Attention for Extrapolation to Longer Sequences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.668701Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f09e0bed508195dcb42211dee623e520cccdf3e48c4ef5e4517389c4d02b2f1a","observation_id":"bdb15049-987a-4da1-a61a-d2be39e0ec4f","resolution":{"observed_at":"2026-08-09T19:58:58.668701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.674983Z","title":"L., Jiang, L., Lin, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.674983Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e15db1e824e97ba1be6414d6a56644f2f7f06c3b9a621f6b0c8ef6132edc5ee6","observation_id":"f43f03e0-9e73-46f7-8af1-e9e1e1bf77c8","resolution":{"observed_at":"2026-08-09T19:58:58.674983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.678043Z","title":"How can self-attention networks recognize Dyck-n languages? In Findings of the Association for Computational Linguistics: EMNLP 2020 , November 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.678043Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:aa99b2cf894f004d0b93db440f6b7e3067c3fac96a864ce283426d62b5f0c3a5","observation_id":"413678e0-ce1f-4660-b64e-4562fa1f8d32","resolution":{"observed_at":"2026-08-09T19:58:58.678043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-1-4419-1428-6_98","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:59.267762Z","title":"and Zilioli, M","venue":null,"work_id":"fef999e9-b9a4-4026-a5f2-781719de1a49","year":2012},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.680967Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:6f56e868899c994c50c2bedd69b4310051c0867ef268f3719cde32f6beedd60e","observation_id":"cee353bf-f5b2-436c-b9ff-c3f3d3e99596","resolution":{"observed_at":"2026-08-09T19:58:59.271061Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.684334Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.684334Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:06856b0b15a0a096adc611962c79c48f8a4d3a8d7c3c0ab9267d8b1e707d73ad","observation_id":"34177a40-0f56-484a-a037-f68ff786bba1","resolution":{"observed_at":"2026-08-09T19:58:58.684334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09081","last_updated":"2019-02-26T16:06:36Z","snapshot_observed_at":"2026-08-02T03:09:12.462232Z","submitted_at":"2018-04-24T15:01:07Z","title":"Efficient Multi-objective Neural Architecture Search via Lamarckian Evolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09081","snapshot_observed_at":"2026-08-09T19:58:58.687657Z","title":"H., and Hutter, F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.687657Z"},"links":{"cited_paper":"/paper/1804.09081","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:20b63bf7603fb3713b5b16e42ee46fc491fa9ae95e6ed519d55490240b2ff181","observation_id":"2b021610-6415-4508-abaa-4961810a04bf","resolution":{"observed_at":"2026-08-09T19:58:58.687657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.691235Z","title":"H., and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.691235Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:6785b981ad4a19545debc07bb72809106fd51dba0311c0d2f23edff18412c562","observation_id":"3f1d9181-09b9-4d8f-9243-da8aa2266734","resolution":{"observed_at":"2026-08-09T19:58:58.691235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.694620Z","title":"Neural fine-tuning search for few-shot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.694620Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:8530058cf533859d61a654c8da616daba03759ff64f88b87561619971b95b00c","observation_id":"ac828527-8e45-4ca8-8387-0bb1ff1491e1","resolution":{"observed_at":"2026-08-09T19:58:58.694620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.697903Z","title":"and Lebiere, C","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.697903Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a0b6db8c9053b6ab8da0e58cbf066f3226a5555d37797067bcde7bf82f37e8ca","observation_id":"dbff4b03-f517-4dc3-acd4-5826475060df","resolution":{"observed_at":"2026-08-09T19:58:58.697903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.700941Z","title":"Looped transformers for length generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.700941Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f3f54d6d850c5887e9ff8392065b3d0ff30ba035709d6842cc2145de6aa3ff42","observation_id":"edaa3432-7fbb-48c6-b2bd-dabfaa92e82c","resolution":{"observed_at":"2026-08-09T19:58:58.700941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.703852Z","title":"and Heit, E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.703852Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:fce15c3c5d9c063e2559656f767351fb7a16073ccc39549c77e2501d962ac14b","observation_id":"3cd76213-295a-4894-9029-7f0a71f759e1","resolution":{"observed_at":"2026-08-09T19:58:58.703852Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.706837Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.706837Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:7abfb60c36a176fb4d2cabcf0b5d66d22b8aecfdc20f61b5a976683359af49ab","observation_id":"513fae5c-712d-4013-ad00-884759b44312","resolution":{"observed_at":"2026-08-09T19:58:58.706837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.710069Z","title":"D., Tenenbaum, J","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.710069Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:ecdfff5f6389874955a1e199236fd1430b4b7d78b3ad1c051d2f0f6e2f801cde","observation_id":"e564fa2f-f2a7-426d-802f-68d4607c2676","resolution":{"observed_at":"2026-08-09T19:58:58.710069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.713262Z","title":"K., Mattern, C., Aitchison, M., and Veness, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.713262Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:4a7515a749b8b94306bd409b96045d52bf907112379ca1af911b804f88fa929a","observation_id":"9c65ff1b-1511-4633-a039-d6ce205be529","resolution":{"observed_at":"2026-08-09T19:58:58.713262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-01T22:22:04.725773Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-09T19:58:58.716216Z","title":"Neural turing machines","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.716216Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f37ada1732abbfe0e2fd542002878e122e74f19aa90e7abe54d449bec6c96e29","observation_id":"4239e0d4-4275-414c-bc04-fb8d6dffcaec","resolution":{"observed_at":"2026-08-09T19:58:58.716216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-09T19:58:58.719581Z","title":"Adaptive computation time for recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.719581Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:90ed2f76ca2030f000137e89ac4916d376deee365b8e6fda715fd8f33b9fb093","observation_id":"a93db7f5-9920-4c03-887d-9298ae2e265b","resolution":{"observed_at":"2026-08-09T19:58:58.719581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.722895Z","title":"and Lopez-Paz, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.722895Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:82e788642c1236914584d6b474500fd49b44dcad42e84e5aba433c1618111306","observation_id":"88bc8a7c-c620-4869-a8d0-479abea927f4","resolution":{"observed_at":"2026-08-09T19:58:58.722895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.726337Z","title":"Characterizing implicit bias in terms of optimization geometry","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.726337Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:6b0151b0e89a396a9d039aae45a6a76881eb924bd7a41933e69759dc60111263","observation_id":"4d9d2a1b-d488-41e1-a1b6-c1671d97d4ab","resolution":{"observed_at":"2026-08-09T19:58:58.726337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.729415Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.729415Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5b3e99f146395d14dbf3d982d3796e13ce45611c9b971e5d7f573c267a4e4279","observation_id":"44dab14c-f8bb-4827-a91b-9d3e4350fee8","resolution":{"observed_at":"2026-08-09T19:58:58.729415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-09T19:58:58.732447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.732447Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:8f383c9dee234b1ae27ece36f6d5e38cac2816974f6c29a78eac221404bb7f41","observation_id":"be4afcfb-2cc5-4b2e-9344-0288894bd5c1","resolution":{"observed_at":"2026-08-09T19:58:58.732447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.736138Z","title":"Formal language recognition by hard attention transformers: Perspectives from circuit complexity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.736138Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9fbfa48a6e21c0276f534e3d556cf646837d44c46ca3d0c38bba59dc267cc81a","observation_id":"2e03eb67-0c04-4e02-9e8c-6d8d92db305a","resolution":{"observed_at":"2026-08-09T19:58:58.736138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.739399Z","title":"The problem of induction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.739399Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:cf34c0801cd39035e621548f58cc52b19554e1a545c1e06198872cc40d924c4e","observation_id":"172daf44-a008-4627-b828-07b0807a8f37","resolution":{"observed_at":"2026-08-09T19:58:58.739399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.742571Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.742571Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:afea7f50a482bdabdfbffdca10ba7517bd85f6a495293f269c8e8e2bc02a9bae","observation_id":"93af8cf7-ffd5-478d-9b15-7564ea8526da","resolution":{"observed_at":"2026-08-09T19:58:58.742571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03310","last_updated":"2024-07-03T17:53:44Z","snapshot_observed_at":"2026-08-07T00:15:01.765782Z","submitted_at":"2024-07-03T17:53:44Z","title":"Universal Length Generalization with Turing Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03310","snapshot_observed_at":"2026-08-09T19:58:58.745856Z","title":"Universal length generalization with turing programs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.745856Z"},"links":{"cited_paper":"/paper/2407.03310","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:272bfee0e8ec94e32ce95a35850c598104b9bba67a3171c538ca305be3761925","observation_id":"cba4097d-275b-4017-a20f-29f87983e020","resolution":{"observed_at":"2026-08-09T19:58:58.745856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.749309Z","title":"Llm- adapters: An adapter family for parameter-efficient fine-tuning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.749309Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a678171032b41bc1ae7f325541dfc603d874563ec99358ec208615fef79913b1","observation_id":"0151658a-260e-4010-8ded-823afd20e297","resolution":{"observed_at":"2026-08-09T19:58:58.749309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07207","last_updated":"2022-03-08T06:47:17Z","snapshot_observed_at":"2026-08-06T08:07:23.771593Z","submitted_at":"2022-01-18T18:59:45Z","title":"Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07207","snapshot_observed_at":"2026-08-09T19:58:58.752493Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.752493Z"},"links":{"cited_paper":"/paper/2201.07207","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2361aa0355e1405177ddaddb956c83cd3633669a62578dd37d7982656fe2dd53","observation_id":"5bf45d6d-a55d-48c3-9818-6f660380f5ad","resolution":{"observed_at":"2026-08-09T19:58:58.752493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"cs.ai/0004001","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:59.823866Z","title":"A theory of universal artificial intelligence based on algorithmic complexity","venue":null,"work_id":"44add1fd-a402-45ed-b055-b75e1d57c0e2","year":2000},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.755767Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:69f10f78d32ae1c9c22353a71d25f9abdc95381f1229076c5f7c5b8e07b2381d","observation_id":"657e4fdb-9d05-44da-a2d8-3986b8d0ba48","resolution":{"observed_at":"2026-08-09T19:58:59.829573Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.758805Z","title":"Making a low-dimensional representation suitable for diverse tasks","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.758805Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a19e95ca40c7dc395d5f8757c0d0bfb6e1148788add195b86ced7097f800dbd0","observation_id":"675b6776-372f-4dca-a9f6-81e79f500e6d","resolution":{"observed_at":"2026-08-09T19:58:58.758805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.762088Z","title":"Going beyond linear transformers with recurrent fast weight programmers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.762088Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:8d62a579b2e1cea61571a200c54c51af87a67e40021d87f934f6d5f6c6a3bfd2","observation_id":"26c8c763-b70f-4a75-9584-cb9206ff87c1","resolution":{"observed_at":"2026-08-09T19:58:58.762088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.765376Z","title":"Length general- ization in arithmetic transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.765376Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:8c716c01d5b69c078728e3a4eca632c13d375e0eea9203fceb59d1366e26ddb1","observation_id":"0db4dc65-c3ef-491c-b69c-81d15eefa39c","resolution":{"observed_at":"2026-08-09T19:58:58.765376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.768403Z","title":"Fantastic generalization measures and where to find them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.768403Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:13eb4532f5cf0787f6a729582b6989a656eb84409ca7cb296b5b7e127ea87147","observation_id":"cbd4a543-dc40-49d7-ae14-95453ad4f7b9","resolution":{"observed_at":"2026-08-09T19:58:58.768403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.775373Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.775373Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a5d41333d96072a2612c63b04201a62e7e2fb25e8345cd58097b750f7afdf94c","observation_id":"c3d13476-7dff-4f53-b64e-fe0fa0407d5f","resolution":{"observed_at":"2026-08-09T19:58:58.775373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.771966Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.771966Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:063283c41e7f84d02e29eb161baaf41daa35502c8f4a8122068545b90b53754b","observation_id":"1d79daad-6d1b-49bf-ac66-5a7513efc8c1","resolution":{"observed_at":"2026-08-09T19:58:58.771966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.782130Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.782130Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:aa182c268987a01d63c9783031706e55c1507ca094c7ede7d6987fcf67540394","observation_id":"81fe6a00-db6c-4f01-94ff-bdf2fd4793f9","resolution":{"observed_at":"2026-08-09T19:58:58.782130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12701","last_updated":"2023-05-11T09:48:55Z","snapshot_observed_at":"2026-07-06T14:22:00.790764Z","submitted_at":"2022-11-23T04:46:28Z","title":"Continual Learning of Natural Language Processing Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12701","snapshot_observed_at":"2026-08-09T19:58:58.778533Z","title":"and Liu, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.778533Z"},"links":{"cited_paper":"/paper/2211.12701","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5c022021a291dfac968ff445cc589980fca8b4ad88261ae347e06eab5add02a8","observation_id":"35193fb4-2386-49c8-b95b-107cc68c6634","resolution":{"observed_at":"2026-08-09T19:58:58.778533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.788633Z","title":"S., Reid, M., Matsuo, Y ., and Iwasawa, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.788633Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:c903a50105e669f2c07932435603e66836914be4c3f0f19323d064c7a1835726","observation_id":"9eee66ea-37e9-44f4-a285-169c4f31585c","resolution":{"observed_at":"2026-08-09T19:58:58.788633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.785202Z","title":"W., Sagawa, S., Marklund, H., Xie, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.785202Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5950b2be8c2b5b4e93e16b2b87955856f19c837e406170534d80f053403a5c00","observation_id":"51350ace-16ae-4893-a040-a98a165d68fc","resolution":{"observed_at":"2026-08-09T19:58:58.785202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.795623Z","title":"L., and Courville, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.795623Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9ccb3965f236d34e9837771015385e92e90c247412b3804da3bcd4f92709974b","observation_id":"cb89c596-5be5-4cdb-b415-d1cc6ae83fd6","resolution":{"observed_at":"2026-08-09T19:58:58.795623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.792001Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.792001Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2d50d8fcee145602c9eb2239062a36ca563a4a41f214f9aa7b016880cc26ee86","observation_id":"32740b3d-dbba-4097-9554-4e93f05347d2","resolution":{"observed_at":"2026-08-09T19:58:58.792001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.808540Z","title":"and Daumé, H","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.808540Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2de1963dc1bd0704cd2c8cfed81ff6dea8e71a61a8949222f1ff54a11df55d02","observation_id":"0238334e-a103-462a-ad73-0aa76853eca3","resolution":{"observed_at":"2026-08-09T19:58:58.808540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04345","last_updated":"2025-06-26T16:08:44Z","snapshot_observed_at":"2026-07-06T15:51:58.017259Z","submitted_at":"2023-07-10T05:06:41Z","title":"Continual Learning as Computationally Constrained Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04345","snapshot_observed_at":"2026-08-09T19:58:58.811971Z","title":"J., Liu, Y ., and Van Roy, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.811971Z"},"links":{"cited_paper":"/paper/2307.04345","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9aa0b2acc6fd6abaa44a6849b789cf779214685eb25b9749deffcdcdd48383de","observation_id":"9e79f6b9-11c6-470c-8261-502306f55608","resolution":{"observed_at":"2026-08-09T19:58:58.811971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.804760Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.804760Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f9a1740cee25943d3477734fa1f994b06556274383f7c372c8eccca44cd22ff1","observation_id":"d178b9e4-35a2-48c3-9ea9-55e9cfb95761","resolution":{"observed_at":"2026-08-09T19:58:58.804760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.819852Z","title":"M., Salakhutdinov, R., and Tenenbaum, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.819852Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:cbc8a810bf8c02471d3e1d9552137b2a57aac019bae04e57b18ffede7d8f02c1","observation_id":"01d723ee-e2a8-4fef-ae4f-8760a9449d90","resolution":{"observed_at":"2026-08-09T19:58:58.819852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.02258","last_updated":"2021-01-06T20:47:02Z","snapshot_observed_at":"2026-08-06T15:05:03.862839Z","submitted_at":"2021-01-06T20:47:02Z","title":"Can RNNs learn Recursive Nested Subject-Verb Agreements?","version":1},"cited_work":{"arxiv_id":"2101.02258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.02258","snapshot_observed_at":"2026-08-09T19:58:59.734968Z","title":"Can RNNs learn Recursive Nested Subject-Verb Agreements?","venue":"cs.CL","work_id":"cfc7d989-e317-47b6-9f72-8cc4b4de1bb4","year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.823159Z"},"links":{"cited_paper":"/paper/2101.02258","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:6d9bb40051d71b1d998179344351055ae666b3278f04d6aa5c8d13a6e4aa2a21","observation_id":"f364f0d2-5eef-460d-a4a6-37f262adc654","resolution":{"observed_at":"2026-08-09T19:58:59.739340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.816143Z","title":"D., and Johns, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.816143Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:159dbe89b80b53cbc162d62c5059aa86499770d833391b72b99eeb86b1403214","observation_id":"8dc1eb60-a94e-4f46-9a9e-670af9425d88","resolution":{"observed_at":"2026-08-09T19:58:58.816143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.830257Z","title":"L., Brockschmidt, M., and Kushman, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.830257Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:54be58021a6cfd7d162bd4a91cae21228b36b73e2f3e662be5e8e65083ec382a","observation_id":"06afaf1d-f684-4b0f-9110-8094a4df3933","resolution":{"observed_at":"2026-08-09T19:58:58.830257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.833369Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.833369Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:b6e5f88857b316983a3126cc0d6f56ccfba1cf0d5e1f7c8741e07051d999fe34","observation_id":"289fdfe6-783d-4bcb-b944-f92af096bf4c","resolution":{"observed_at":"2026-08-09T19:58:58.833369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.826697Z","title":"Learning a meta-level prior for feature relevance from multiple related tasks","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.826697Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:97b1e77090ef4ebed1c501045d780918b3b88a5cd55b3c0029c6a27564516b4a","observation_id":"69c8e9ad-ae21-4538-9f1d-5fda9ce681e4","resolution":{"observed_at":"2026-08-09T19:58:58.826697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.839706Z","title":"R., and Eisner, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.839706Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a5ae6a1a78e14e8c38de846d345840ac088721d7c0ef034edd247fa5b486eae4","observation_id":"1302c1d6-5f2b-4685-b48f-e1d4758b1fae","resolution":{"observed_at":"2026-08-09T19:58:58.839706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.842701Z","title":"T., Goel, S., Krishnamurthy, A., and Zhang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.842701Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:33d6edae07d809cf79b038262815d130dfcef53a8c34bd6c3af7ea8b34920cb7","observation_id":"9f714ce5-f1fe-4c0e-a287-873174679781","resolution":{"observed_at":"2026-08-09T19:58:58.842701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.836405Z","title":"and Vitanyi, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.836405Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2a88225aa5751b702c50790b61c8de7b81fe72fd8dd52cc8a479930ab869de51","observation_id":"2dfc607a-9572-4396-9aea-38c8b504fc39","resolution":{"observed_at":"2026-08-09T19:58:58.836405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.849361Z","title":"Darts: Differentiable architecture search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.849361Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:37bb57875b2f05f24bed51251502e67505b4454118b31cdaa6c1e8a36f7a9dc8","observation_id":"da24bc99-2a5b-45c0-9083-7f8b5cdfeede","resolution":{"observed_at":"2026-08-09T19:58:58.849361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.10937","last_updated":"2022-02-04T03:45:53Z","snapshot_observed_at":"2026-08-10T01:52:12.896724Z","submitted_at":"2020-08-25T11:00:46Z","title":"A Survey on Evolutionary Neural Architecture Search","version":4},"cited_work":{"arxiv_id":"2008.10937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.10937","snapshot_observed_at":"2026-08-09T19:58:59.652504Z","title":"A Survey on Evolutionary Neural Architecture Search","venue":"cs.NE","work_id":"463cb08a-5bab-4e13-9d6c-ed14366501d2","year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.852333Z"},"links":{"cited_paper":"/paper/2008.10937","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:b8e145a594884882ad6a236e37ce489ec56a871ad0c1485f108be014f1a73326","observation_id":"5ffd42ed-65a8-4474-b44e-c95d57a2ac76","resolution":{"observed_at":"2026-08-09T19:58:59.656463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.846097Z","title":"Hierarchical representa- tions for efficient architecture search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.846097Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e9550ba1d6fb34e1c3532949d4b8c9e5befeaa4a3bff7f42cc2368bd62b2f008","observation_id":"2766de11-f9c9-4c92-8d8c-40f6767e646e","resolution":{"observed_at":"2026-08-09T19:58:58.846097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.858556Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.858556Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:296fbab54029b91c5563cda3f579dc64d0c9951510b48913c4e8c76e96c79a19","observation_id":"7ddcf38a-4b7a-4f6d-b507-36985e65f4de","resolution":{"observed_at":"2026-08-09T19:58:58.858556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06979","last_updated":"2024-07-29T20:51:25Z","snapshot_observed_at":"2026-08-09T18:26:00.758042Z","submitted_at":"2023-09-13T14:15:03Z","title":"Auto-Regressive Next-Token Predictors are Universal Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06979","snapshot_observed_at":"2026-08-09T19:58:58.861348Z","title":"Auto-regressive next-token predictors are universal learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.861348Z"},"links":{"cited_paper":"/paper/2309.06979","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e96b7a3f2fb6b9e7433673dc35b914ca0aa5bb89c569fee692df223defd94cd3","observation_id":"268bee84-5104-42e0-82e5-acd092f25bf0","resolution":{"observed_at":"2026-08-09T19:58:58.861348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.855579Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.855579Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:49b18e1fddf99f5f56174433a1fe0f6729954058d445f2b6bbeef756c287f8e6","observation_id":"97f765ef-a37d-4586-85b2-cbb028f456f3","resolution":{"observed_at":"2026-08-09T19:58:58.855579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.867835Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.867835Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f9385203cf2e8351b2debc8fbb3b15a3407c4173f7e9f19378ad83c483c0ad34","observation_id":"968c25da-07b2-4709-b58e-b802f328b96f","resolution":{"observed_at":"2026-08-09T19:58:58.867835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:48:06.005212Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":93,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":200},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 200 outbound references and 1 inbound Pith citation observation for arXiv:2502.00197."}