{"as_of":"2026-08-07T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cda897c1e228b86d46a1d7d96569fe107c1a511e11aa6f4fa2c0838715c4da7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:51:38.925694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:45:40.144444Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-08-05T10:51:38.925694Z","title":"Fleet, and Jimmy Ba","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.03677","last_updated":"2025-09-08T06:17:26Z","snapshot_observed_at":"2026-08-06T07:57:11.469546Z","submitted_at":"2025-09-03T19:54:23Z","title":"Insights from Gradient Dynamics: Gradient Autoscaled Normalization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:38.925694Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2509.03677"},"observation_digest":"sha256:64e2894392a81b66dbc7961e80fd80fcbb6fdf0a675d818a5e55e0c69670c9d5","observation_id":"daf8b0b3-9c90-4ece-9d20-2d14d4ef2401","resolution":{"observed_at":"2026-08-05T10:51:38.925694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":"2007.04532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-07-01T09:45:40.144444Z","title":"Fleet, and Jimmy Ba","venue":null,"work_id":"3cbf9724-1f19-4b77-bfe5-40e622363a96","year":2007},"citing_paper":{"arxiv_id":"2603.10225","last_updated":"2026-04-28T20:03:21Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T20:51:49Z","title":"Rethinking the Harmonic Loss via Non-Euclidean Distance Layers","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T12:59:12.878557Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2603.10225"},"observation_digest":"sha256:8f3cfdd43cacd3541fa930bb0c976393ffa2e730c6ee4b17e634556a671b5f6c","observation_id":"c7922e86-0307-40b8-9ca9-52f3962e69af","resolution":{"observed_at":"2026-05-15T13:00:00.617787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-07-12T21:34:30.078813Z","title":"A study of gradient variance in deep learning,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2604.12144","last_updated":"2026-07-01T22:34:57Z","snapshot_observed_at":"2026-08-02T05:18:11.450897Z","submitted_at":"2026-04-13T23:48:35Z","title":"VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T21:34:30.078813Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2604.12144"},"observation_digest":"sha256:dcef978a44bea0e43b6c77d066238c407d2a4f6fbdd3854051bafc0ed1285a11","observation_id":"52dce4ed-24db-435a-bc31-f80f64c8123e","resolution":{"observed_at":"2026-07-12T21:34:30.078813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":"2007.04532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-07-01T09:45:40.144444Z","title":"Fleet, and Jimmy Ba","venue":null,"work_id":"3cbf9724-1f19-4b77-bfe5-40e622363a96","year":2007},"citing_paper":{"arxiv_id":"2604.12145","last_updated":"2026-04-13T23:49:27Z","snapshot_observed_at":"2026-07-30T03:55:58.250974Z","submitted_at":"2026-04-13T23:49:27Z","title":"Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T14:49:51.481873Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2604.12145"},"observation_digest":"sha256:b79951924ab6b43e5ac1e3aca9aaf6774169895781bbe3e49022214e79746d89","observation_id":"260c7e6c-e257-48aa-8d76-3ae0a4508dec","resolution":{"observed_at":"2026-05-11T11:31:01.909242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":"2007.04532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-07-01T09:45:40.144444Z","title":"Fleet, and Jimmy Ba","venue":null,"work_id":"3cbf9724-1f19-4b77-bfe5-40e622363a96","year":2007},"citing_paper":{"arxiv_id":"2606.31636","last_updated":"2026-06-30T13:20:08Z","snapshot_observed_at":"2026-08-07T18:16:05.038813Z","submitted_at":"2026-06-30T13:20:08Z","title":"LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T06:14:12.000392Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2606.31636"},"observation_digest":"sha256:f68f81c9b7fe4cab72c5908b085f9f32560f6fde80a09813cd947598363c6f97","observation_id":"a7302547-b729-4c6b-8878-a3179a443f90","resolution":{"observed_at":"2026-07-01T09:45:40.145766Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-08-04T00:41:45.205816Z","title":"A study of gradient variance in deep learning,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-07T14:16:27.480135Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.205816Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:6090796f68250ca6ab8fe832afa073eddba6aed0e848a24d9300b609a2eda162","observation_id":"707b3328-6f5e-4522-bb94-1ef4f70af353","resolution":{"observed_at":"2026-08-04T00:41:45.205816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2007.04532/citation-record","integrity":"/paper/2007.04532/integrity","json":"/paper/2007.04532/citation-record.json","paper":"/paper/2007.04532"},"outbound":[],"paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:56:43.715478Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2007.04532."}