{"as_of":"2026-08-08T15:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5627f8aaa32cc2852fc04c3bcc37ff2d59e712a3fb2cc529c940cca3a13a459d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:25:00.049554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T15:34:48.385189Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-07T15:25:00.049554Z","title":"Large language model as a policy teacher for training reinforcement learning agents.arXiv preprint arXiv:2311.13373, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-07T15:18:11.639286Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.049554Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:9471c874c1020fd9139628724724d51e2f86b633e73d93415f3466de0f58a32f","observation_id":"dcc67497-61f2-4cda-bb79-433cc4f087b4","resolution":{"observed_at":"2026-08-07T15:25:00.049554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-07T11:18:46.991142Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02951","last_updated":"2025-07-23T03:40:09Z","snapshot_observed_at":"2026-08-07T11:09:37.163183Z","submitted_at":"2025-06-03T14:46:00Z","title":"Adaptive Graph Pruning for Multi-Agent Communication","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:46.991142Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2506.02951"},"observation_digest":"sha256:8989b5a6976803022d44785f1569264380feacd5b532c4e2d503846840a5d15a","observation_id":"8d5c5761-013b-439b-8053-a89b1157fb5b","resolution":{"observed_at":"2026-08-07T11:18:46.991142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-04T20:49:37.871050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-06T21:58:05.954500Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.871050Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:3cc29bbaf9381e98bc1ce564725ccab623b9abf475b7df65bd8bfbb1e458cd21","observation_id":"328e2211-4bb1-46a9-81e1-360362a1d399","resolution":{"observed_at":"2026-08-04T20:49:37.871050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":"2311.13373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-06-30T15:34:48.385189Z","title":"Large language model is a good policy teacher for training reinforcement learning agents","venue":null,"work_id":"939f8e87-2c29-437b-93a1-ad9d5fdee476","year":2009},"citing_paper":{"arxiv_id":"2602.04129","last_updated":"2026-05-06T00:09:55Z","snapshot_observed_at":"2026-07-06T22:44:28.488131Z","submitted_at":"2026-02-04T01:46:02Z","title":"KGLAMP: Knowledge Graph-guided Language model for Adaptive Multi-robot Planning and Replanning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T08:07:48.508022Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2602.04129"},"observation_digest":"sha256:41ecab292accb90934148c838e72811d11071918c8bf4b5512c459cb99b77c5b","observation_id":"2d79072f-fde0-4884-bf6a-a5115394394e","resolution":{"observed_at":"2026-05-16T08:10:45.591012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":"2311.13373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-06-30T15:34:48.385189Z","title":"Large language model is a good policy teacher for training reinforcement learning agents","venue":null,"work_id":"939f8e87-2c29-437b-93a1-ad9d5fdee476","year":2009},"citing_paper":{"arxiv_id":"2605.17359","last_updated":"2026-05-17T09:55:18Z","snapshot_observed_at":"2026-08-02T23:39:33.688741Z","submitted_at":"2026-05-17T09:55:18Z","title":"Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T13:38:07.140289Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2605.17359"},"observation_digest":"sha256:dc491821fd9d8b742bd560e9d979d55da8f8fc49214dc9acb95be0473f8ff28e","observation_id":"d97c92c8-23ea-48e7-886e-eb0719a2c374","resolution":{"observed_at":"2026-05-20T13:38:19.074837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":"2311.13373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-06-30T15:34:48.385189Z","title":"Large language model is a good policy teacher for training reinforcement learning agents","venue":null,"work_id":"939f8e87-2c29-437b-93a1-ad9d5fdee476","year":2009},"citing_paper":{"arxiv_id":"2606.00083","last_updated":"2026-05-22T16:04:22Z","snapshot_observed_at":"2026-08-02T22:15:21.959965Z","submitted_at":"2026-05-22T16:04:22Z","title":"From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T15:25:14.906470Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2606.00083"},"observation_digest":"sha256:3327fe6006841a0a282a5a81ffd7654c28b7e785c589ee2e674777e359a66297","observation_id":"5b19795d-25be-4734-abfd-b363cd9aa9aa","resolution":{"observed_at":"2026-06-30T15:34:48.386630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.13373/citation-record","integrity":"/paper/2311.13373/integrity","json":"/paper/2311.13373/citation-record.json","paper":"/paper/2311.13373"},"outbound":[],"paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","latest_version":6,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2311.13373."}