{"as_of":"2026-08-10T23:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fd1dc3a2f341df3bbe315d9a392399c0cc964401e21eb78a8e10b3e22a3e23f","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:59:06.021532Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T08:04:06.432613Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04206","snapshot_observed_at":"2026-07-14T08:04:06.432613Z","title":"arXiv preprint arXiv:2507.04206 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10959","last_updated":"2026-07-12T23:24:42Z","snapshot_observed_at":"2026-08-03T13:16:14.672928Z","submitted_at":"2026-07-12T23:24:42Z","title":"WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T08:04:06.432613Z"},"links":{"cited_paper":"/paper/2507.04206","citing_paper":"/paper/2607.10959"},"observation_digest":"sha256:5e6b5445ff69fe366aff67c5e394676e630539605adf0486a2e282e531006fdd","observation_id":"5519170b-8034-4edf-8eb0-c05edc37795f","resolution":{"observed_at":"2026-07-14T08:04:06.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04206/citation-record","integrity":"/paper/2507.04206/integrity","json":"/paper/2507.04206/citation-record.json","paper":"/paper/2507.04206"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T19:59:05.115154Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.115154Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:fb6b61382da02ee21a33a0e326aee26c7443c2f6baa51325580fcd7749acb8ec","observation_id":"4cf05d37-47c2-4ac6-9b1c-93477e120c7e","resolution":{"observed_at":"2026-08-06T19:59:05.115154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-06T19:59:05.216957Z","title":"Understanding warmup-stable- decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.216957Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:3872992d97351e4e16f81b33a7f57b6803390d5a96bc874cc9bfc762598ef63b","observation_id":"46ec7f39-826e-43f3-ad28-e178f90c2d64","resolution":{"observed_at":"2026-08-06T19:59:05.216957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12243","last_updated":"2025-01-21T16:03:42Z","snapshot_observed_at":"2026-08-10T17:19:26.754174Z","submitted_at":"2025-01-21T16:03:42Z","title":"FOCUS: First Order Concentrated Updating Scheme","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12243","snapshot_observed_at":"2026-08-06T19:59:05.396551Z","title":"Focus: First order concentrated updating scheme","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.396551Z"},"links":{"cited_paper":"/paper/2501.12243","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:7bbf914708dbaaddbc91b5758c775d2874401006c967638bf5ce9b627ec651ff","observation_id":"a5b58d3f-becb-42e6-8659-1b47594e9bf5","resolution":{"observed_at":"2026-08-06T19:59:05.396551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-07T15:44:58.187412Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10559","snapshot_observed_at":"2026-08-06T19:59:05.518604Z","title":"Neural thermodynamic laws for large language model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.518604Z"},"links":{"cited_paper":"/paper/2505.10559","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:b2fa7b87eed5c9fbf3e80408d468b6dbbd9cff8cc8c53b9bf8a4a01fe24ecfd9","observation_id":"52d8cbf4-a455-4428-b670-c19fcb8309d5","resolution":{"observed_at":"2026-08-06T19:59:05.518604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:07.142149Z","title":"Nonequilibrium thermodynamics of the markovian mpemba effect and its inverse","venue":null,"work_id":"8a649e7c-9c03-4c6d-80d8-65a61e384f8c","year":2017},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.614435Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:04b64813313cbc339175f2258b25331ab1a58844d1fe956471759189e3f0897f","observation_id":"8cff97b3-c0e2-4bb3-9cb2-190188754944","resolution":{"observed_at":"2026-08-06T19:59:07.184869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:07.038103Z","title":"Mpemba index and anomalous relaxation","venue":null,"work_id":"74d9d106-9f9a-4ae3-851a-5ef272169e34","year":2019},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.692399Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:2f5857ac4bd087b4635c3b50f127392181bc60a33e369f83e6e9dc663e20aec1","observation_id":"e5b96d5b-d2a8-448f-b998-e1d83a34acaa","resolution":{"observed_at":"2026-08-06T19:59:07.093283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:05.755041Z","title":"Speedups in nonequilibrium thermal relaxation: Mpemba and related effects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.755041Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:bd75fed3324af8e2768604e59bcd01cbe633fedff86855b20db0842f93fc7980","observation_id":"c7c9f9b5-f3a5-4cc0-8977-b2f191fee7c4","resolution":{"observed_at":"2026-08-06T19:59:05.755041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.900941Z","title":"Precooling strategy allows exponentially faster heating","venue":null,"work_id":"1e2ad2b6-d8ca-4639-99a2-e7980ea70eab","year":2020},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.829010Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:abc0c15b380f202ef4af91c2fcbd48b37c3e589548591106398caf61fb936546","observation_id":"7123ae6c-5701-4eb4-9fc2-dad18be8ad8e","resolution":{"observed_at":"2026-08-06T19:59:06.945544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.765674Z","title":"Shortcuts of freely relaxing systems using equilibrium physical observables","venue":null,"work_id":"d6fdd902-cf41-4d0d-aa16-5ee7cb0d31d3","year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.884719Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:78fcc96bf7642a374204a5d04a9bd87caecc66971a4f25f44fb6697fcd92b4a7","observation_id":"eaf1d537-f2e9-41ce-9000-fcb7351cf080","resolution":{"observed_at":"2026-08-06T19:59:06.817123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.649320Z","title":"Stochastic gradient descent introduces an effective landscape-dependent regularization favoring flat solutions","venue":null,"work_id":"7260b222-e210-45f4-abaf-60d4473e7912","year":2023},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.943662Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:d3033161b00f81b356526d0b9091c6573a72f4564a635d05c1ae03a8d1cc1ed6","observation_id":"af8d4fb4-6ceb-48bc-9cd6-5e16548c12ca","resolution":{"observed_at":"2026-08-06T19:59:06.714162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.424622Z","title":"Analyzing & reducing the need for learning rate warmup in gpt training","venue":null,"work_id":"b37c6a24-2443-4af6-9e81-ccfcadcc6239","year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.982823Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:328bb7b23c090e340509d5d67c531de2a603ddff89829c33aa6ee10968548547","observation_id":"e64ce85d-9390-418e-9228-5598d797d7cc","resolution":{"observed_at":"2026-08-06T19:59:06.545824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.187570Z","title":"temperature","venue":null,"work_id":"834c73bd-8c90-4482-ab21-85a4b91bddad","year":2023},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:06.021532Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:bc8a3d4a0468953cbec9848ee18cd8a4b45cd735236d942298f3c886ff952cbb","observation_id":"15a7b24f-10fe-45ba-b736-8e028fc9f911","resolution":{"observed_at":"2026-08-06T19:59:06.294133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T19:50:42.879569Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2507.04206."}