{"as_of":"2026-08-05T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86cfad8f3386782b459964742857b7e833799f9fb82b242d6f4334056953e3ff","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.09883/citation-record","integrity":"/paper/2606.09883/integrity","json":"/paper/2606.09883/citation-record.json","paper":"/paper/2606.09883"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:96dfc43b3f6190a31735119fbf4f2ab8c41cb4521c73f9e0d7612294c5f20104","observation_id":"9c019f15-2c7f-49e2-a140-3517abf27c08","resolution":{"observed_at":"2026-06-28T07:01:44.350935Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:63073e2824238502412bb36edecdfdf21c9b0375515f3a9b4ddab320e9134044","observation_id":"41fcf300-4b88-4686-8e7e-c65e293bb56a","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:188c7689d2bb2163846902c87e9919ea05451404009457b55c6c60b177975fa6","observation_id":"17c627f7-10fa-4bb0-b787-a1c00e68004c","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:32f7063c8e1d4de4687743e8d7d1c710aa0bdf9d6516a4a8c14c5bbef888a230","observation_id":"06adb225-299a-4987-a378-8ada585435be","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:232f9e4eec3e3251827f5606d4d012580fd34e0d7836689f21fe66b0c6d085e1","observation_id":"5a41f56a-ad4e-4110-b55d-7f925c6ec038","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Output only the requested text blocks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:74de7caac74ae1bacf4431569c4a716b77f6433c8be588810b09e62b76b5f28a","observation_id":"64f1be4b-8902-4965-be48-a6e93e12ac9a","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:76f909dd5608dc48974de12bf7d48e73127ee6caace267f0be7ed9fb365d258f","observation_id":"30a195a5-ebf0-4583-a9b9-190a4de8fdc0","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Do not refer to other subproblems, previous results, or hidden context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:761e456ac1740f5ba54cfccf9e6ab0e5e10f6bf8d13fd3f8ea94339b6bb68e56","observation_id":"79fdd6e5-a81e-409e-9292-21cd71056276","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"This restatement can be natural prose or an explicit ‘Given:‘ clause","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:dbba220e7632db5630a776c101eb3aa5cc1dfb58a5849339a1d63f8627b4a1b9","observation_id":"4783e974-6592-4942-8b47-9bb8f403e986","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"show that","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:aae50f7df712de0a4b94d605cf606826773658cc05776b65caf74f4e03ef2a93","observation_id":"05951660-e96c-4b33-bec4-9086cd0230be","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"is the final answer correct?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:f9e1880f112cecc05ce9a89c0a4e1836ee4e9cbc37290797912709895820f1f0","observation_id":"86f6260b-b9a0-4618-89f4-f957510b3350","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Do not invent abstract variables like S, T, or R unless they are defined inside the same subproblem and genuinely useful","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:3fdcb44b8fd2297396c87d56436863226fd07b62ddb4d1543ba184d386103eba","observation_id":"1996ca7c-318a-4923-88a9-21a0a6ff5c53","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Do not include explanations, equations, or multiple sentences in ‘answer‘","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:08967592ddf850951228b53e1a4ad04adc0cc8ec059f910b8e92ef50435cab8b","observation_id":"dcedcf2f-afea-4ddd-bab1-97d7906b2cee","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Never leave any field blank","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:2b5e7816e7c05c159f45369a2d2cf7f1181e53420b45357750f94e0aecec1d4c","observation_id":"46b6f42a-9a73-4555-aba5-2fa3d34bb276","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:52e5e02854d0c82c8a2f9d09bdbb4c7799fc4ab8931233c3be6049c5e2ab3745","observation_id":"e87a1662-4257-4c61-8ec8-89a3afbb1d1a","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Avoid repeating the same shell sentence with only numbers changed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:c5553c632836612285b4733e564f2a542f35bb3b4ac93c1a0461efea2e9a170f","observation_id":"747466d0-2284-4e30-8f28-7b4dcf758868","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"If the problem feels simple, split it into smaller concrete computations anyway","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:4813ca9061c393375d568e885ed6e76a1004a26ab12790b410546b2ee597a9aa","observation_id":"3ae2eff4-3ca7-49a1-b038-81fe39ccc5f5","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:1d182439ed7c97095c34185085e043c51c9c31191a7fa991171a98019109d2bb","observation_id":"6f06dee5-9949-4f44-b25a-2d545a59de61","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Each subproblem should ask for one concrete intermediate quantity, relation, or check","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:e1a993bd3b056fb9e6cec901f549749aa43379e611f0c3810a2d4db856208aad","observation_id":"4782c24c-1bb2-467d-b515-1a72f09880f1","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:267e961725e906e79214d40611f773cee7181412046b6caf22549be5d07880aa","observation_id":"d8eca67b-4182-4449-992f-7535029fd602","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:ddfea6206893845654369249994e4fccf47dc2a0004948e9a7a37d754c7df450","observation_id":"69ca7f9c-7778-42d5-8b9e-dfc93913b010","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Do not leave ‘solution ‘, ‘answer‘, or ‘verification‘ blank","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:c0c013f02bec0cf67b590a521c22b1f525e26991b2773795d77f40c9635697c6","observation_id":"9a47a98e-9c73-403a-b51b-7c91a889ea33","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Do not turn a subproblem into a mini-lecture or a long multi-part derivation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:9f10908bbea49f8a7a43293408c7db26453696b3cb9884b778c6078695dc7321","observation_id":"c3e50a96-577e-4979-ac1c-ffac51372424","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Use 7 or 8 only when the original problem clearly needs them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:f05d9936066242da384627239e21044393422195a3ae2b2f8140f68bf31f1b66","observation_id":"bf258155-77cd-4141-aeb7-13daec0b6d1c","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Never write phrases like ‘from the previous step‘, ‘from Subproblem 3‘, ‘using the result above‘, or ‘same as before‘","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:7e6cdd05eaccbe9317583ee8f6ff5070eabe3c00c223e0fecfb608dc6c4c1f14","observation_id":"5034a7e8-d837-4849-a3b1-46f59071f37e","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"The final subproblem must always contain a non-empty ‘solution‘ and a non-empty ‘answer‘","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:37be18ba7fd6df73ac4e265601e726859b3098d99f9c88b74c1c71902e9abd37","observation_id":"19370d56-c767-4887-80ec-b72c12a6607d","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"If the original answer is an expression, give only that expression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:4bb89e328fed2bfda4bac9e02588492ad1a01a7f1b85304e6d6da71a739082ee","observation_id":"73faa848-2e28-4bf3-ade7-b4c21c980526","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"If the last step would only check correctness, merge it into the previous computational step and keep the final answer there","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:6b5aa8eb6a1411fc5a43683690c21a8b5eca79b06c2f6586f2b6eb7ea6bdccbb","observation_id":"f9af39f7-598c-4ded-a048-c504c3822add","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"Do not write explanatory prefixes such as ‘Therefore‘, ‘So‘, ‘The answer is ‘, ‘check‘, ‘because‘, or a full sentence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:dfca7a327507b61e8d344de7a9a1536eec6bf617fdb74bf06f5e906d2a518d49","observation_id":"cb0cec48-91c8-4f63-87ee-4be6beae670c","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:2346ef6f8c1f291d5b07983e95b818d9766ab125466981cee9c195fc688c36bc","observation_id":"2d71de62-e3b2-4068-8495-df8471fcb826","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:55be06a8eca26611bd8cc608aa0fe1ec597e5d94fe2260b5e2370ad44ad73036","observation_id":"7a589746-4b9d-4003-8223-67cd994012ec","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:3c2265912c8e2ec52c3b894ef53f6b27f8f95dd27a41577ce639d5ead98b0469","observation_id":"0b3f24fe-3d5a-4d07-8814-eb55a702cb0b","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:c8d1943c66d65e6518b525c3cc358156d3c781ec04cf04042feb8f81a6193f46","observation_id":"9be0412e-d611-4885-b3b4-fb59c8978883","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:32d209f339cd80dfcd8beea1b2998fc2a3f7426278d7321893d0c53807ea5014","observation_id":"4d55759f-67c0-4e2a-b659-afc03e68f1b8","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:4a5636ea6caf5c5ec9a40cf790190e47f43d7ceb11f3969f1609e338f4eebba3","observation_id":"1e8cf8cf-78d0-46c0-870a-db8fe712ad51","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:ffdc0154ed3d6adb101f3af4aa46c7030e7cefc35b63545aa943d3ffca5e4989","observation_id":"711d9049-3b33-4cd5-8bba-73bab9ee1a61","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:8590adde1f5758edc6b6d533469462c6d4e4cf490fb6c5a40a745153512f100a","observation_id":"9017a485-850b-415f-8045-70c0e3263f34","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:62d6949e4ccb6e2601545f7ca04c1e0f3cdc5ae343378ba4ceabd0982afdad08","observation_id":"5975ba5e-8dce-41f6-9808-27977a950522","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:ab706002e8fb0d201853af20f1aa7d0759ea7bab50ab0d8ea53ef586c6f93eb4","observation_id":"5172a46a-5c14-4984-b1c0-f2d554865378","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:00663c55832542eb8992cd0b335254c95476d174f9c95b2c54d785f0948fccd7","observation_id":"790696ad-21be-42dd-bb3d-10d92313f679","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:f18976597ccdc72fcb43891827f09a2042bc12f29167a95894aa40af22739ab6","observation_id":"f7c79992-5738-494a-bb16-aa3e581e2980","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:b30019ac1c8b50409d8302c0eeb6037945ed0c2591c2e7a114cc5d7774012398","observation_id":"5d076cd4-016d-457b-890f-2425aff52f11","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:94ffe78eaa45df19fbbcac1862f61d0cbd2ea073fb6e201bbb24edb7cbced650","observation_id":"96f61686-b245-40d7-9e0c-581bfb9ea0bb","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:5f59578d5ba78acab98c70d8c6d0a83ec45c4daed3821d80466b4763635fe6a7","observation_id":"8414f0d0-907b-4e98-ba8b-56eab90d50db","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"results\": [ {","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:f15db1661c7dc4f05a9b6b7c47dc0aff1909af460b11460288b78c1ef17f4de2","observation_id":"c15dfecf-6b25-46aa-8325-26554c3fe840","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:52:15.641447Z","title":"subproblem accuracy goes up, therefore root accuracy goes up","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:15.641447Z"},"links":{"citing_paper":"/paper/2606.09883"},"observation_digest":"sha256:436ac3f5de38abbb5ccc1c4771eff93b2c800e9932cb436cbb9fa55a2e10d2a8","observation_id":"92b41ef1-4290-47ed-b83d-6d0fcc6c5856","resolution":{"observed_at":"2026-06-28T06:52:15.641447Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09883","last_updated":"2026-06-03T06:40:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T06:40:04Z","title":"TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2606.09883."}