{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc593889205a70379cf6f58b45af83b50f1585ad4595f762cb49a4ebf56b7a1f","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:05:22.403317Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03519/citation-record","integrity":"/paper/2506.03519/integrity","json":"/paper/2506.03519/citation-record.json","paper":"/paper/2506.03519"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.819605Z","title":null,"venue":null,"work_id":"0e9d6dca-cecd-4c26-9546-c63b13691935","year":null},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.356294Z"},"links":{"citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:b4ad29988757e74670710933647360abebd61de4d1e12a340ac2d1ec4390e32f","observation_id":"ab622887-d493-49c7-ab19-8766a043a4c8","resolution":{"observed_at":"2026-08-07T11:05:22.825443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.642939Z","title":"ActionType","venue":null,"work_id":"86576424-7cc0-41b9-9c2a-263b4ccacf8d","year":null},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.375042Z"},"links":{"citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:cc5d85fa403112af369251a442fef0966c9543d649ae19e717d40e1f7b474c3c","observation_id":"614ad4f8-f7e8-4ae2-ad08-332c4c4ad9a6","resolution":{"observed_at":"2026-08-07T11:05:22.648791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.837096Z","title":null,"venue":null,"work_id":"b12e0cc1-f744-4269-85e4-e401b9441f31","year":null},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.383124Z"},"links":{"citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:f50187e655328b8780f263ddeaffe7b8d757488a9a59a77e6f290ed2f94758ee","observation_id":"698ce336-76d8-43ca-b54e-32f1acbf1a5d","resolution":{"observed_at":"2026-08-07T11:05:22.842161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.618104Z","title":null,"venue":null,"work_id":"aeff8833-94bd-45b2-9c66-3e57bde285e5","year":null},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.389860Z"},"links":{"citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:a7f3daf508dea567bad1f9c26e9107abd8da5555518d15201c2d38b0162b8dc5","observation_id":"6cda9d7b-ba50-4b31-a9e2-dbefad2e8e02","resolution":{"observed_at":"2026-08-07T11:05:22.625508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.665660Z","title":"This state will be used as a basis for decision making","venue":null,"work_id":"bd09ef41-f1d2-4ce3-8889-b3340b574c8a","year":null},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.397174Z"},"links":{"citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:fd81d2b8e875c07e243ad8215f6f7fcb42ceb75b9e808fe2be1664cee7fc7e1a","observation_id":"f67302ea-5bca-4e5f-8804-4441f9a275bd","resolution":{"observed_at":"2026-08-07T11:05:22.800252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.596111Z","title":"Inform","venue":null,"work_id":"b0ad50da-e4ce-43f6-aeb9-aa169db16440","year":null},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.403317Z"},"links":{"citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:db01b75d2960cd2190a565a6a8ea1c600cebc0d6166ffd143ad0cb79ec91d2f0","observation_id":"067f63cb-f2cb-4931-80c5-611af46cf4db","resolution":{"observed_at":"2026-08-07T11:05:22.601998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14457","last_updated":"2024-06-20T16:15:40Z","snapshot_observed_at":"2026-07-06T18:34:19.513528Z","submitted_at":"2024-06-20T16:15:40Z","title":"Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue","version":1},"cited_work":{"arxiv_id":"2406.14457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14457","snapshot_observed_at":"2026-08-07T11:05:22.574873Z","title":"Rewarding What Matters: Step-by-Step Reinforcement Learning for Task-Oriented Dialogue","venue":"cs.AI","work_id":"b07a5f04-0d0a-42fd-b234-8b7521fd0c54","year":2024},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.322470Z"},"links":{"cited_paper":"/paper/2406.14457","citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:77931be4128577a1e30380f9c4cbe1c2d00f72281943fe2aeb9aeac366d39a41","observation_id":"d419a269-9233-4256-a3e1-844ba3466843","resolution":{"observed_at":"2026-08-07T11:05:22.580157Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06176","last_updated":"2018-05-23T17:52:27Z","snapshot_observed_at":"2026-07-06T06:19:16.799773Z","submitted_at":"2018-01-18T18:57:33Z","title":"Deep Dyna-Q: Integrating Planning for Task-Completion Dialogue Policy Learning","version":3},"cited_work":{"arxiv_id":"1801.06176","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.06176","snapshot_observed_at":"2026-08-07T11:05:22.533168Z","title":"Deep Dyna-Q: Integrating Planning for Task-Completion Dialogue Policy Learning","venue":"cs.CL","work_id":"7cc685d1-890e-49ae-b72a-ba73a0d2d300","year":2018},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.329232Z"},"links":{"cited_paper":"/paper/1801.06176","citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:ea13269e7bcd44e815cf542182f2fe13d2c785e7722a4d4cc6a35afd56c65887","observation_id":"ba326a11-4c43-4765-8043-fe43be17f6ea","resolution":{"observed_at":"2026-08-07T11:05:22.540401Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03095","last_updated":"2021-05-09T11:53:04Z","snapshot_observed_at":"2026-07-06T10:46:54.447404Z","submitted_at":"2021-03-04T15:22:00Z","title":"A Survey on Spoken Language Understanding: Recent Advances and New Frontiers","version":2},"cited_work":{"arxiv_id":"2103.03095","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.03095","snapshot_observed_at":"2026-08-07T11:05:22.496500Z","title":"A Survey on Spoken Language Understanding: Recent Advances and New Frontiers","venue":"cs.CL","work_id":"bc11614b-1126-4c89-b14c-374fc2d0d525","year":2021},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.335500Z"},"links":{"cited_paper":"/paper/2103.03095","citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:0b79c5854f74fee4ab05456206401571e1b1e4141b37a7a36d5539e2699fad65","observation_id":"749f1a0c-9933-4742-b4c9-c4bdbe296c5e","resolution":{"observed_at":"2026-08-07T11:05:22.504941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18013","last_updated":"2025-08-15T03:28:39Z","snapshot_observed_at":"2026-08-08T02:24:48.712537Z","submitted_at":"2024-02-28T03:16:44Z","title":"A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18013","snapshot_observed_at":"2026-08-07T11:05:22.341927Z","title":"Zihao Yi, Jiarui Ouyang, Yuwen Liu, Tianhao Liao, Zhe Xu, and Ying Shen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:22.341927Z"},"links":{"cited_paper":"/paper/2402.18013","citing_paper":"/paper/2506.03519"},"observation_digest":"sha256:9201cd47e19d12285618eb253a953e90c5aa4d2a9b81479bd3d2a7cbbeb7faff","observation_id":"ffb48332-23e7-482f-a698-9f427905b6cd","resolution":{"observed_at":"2026-08-07T11:05:22.341927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03519","last_updated":"2025-06-05T06:09:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:58:43.727280Z","submitted_at":"2025-06-04T03:07:55Z","title":"An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2506.03519."}