{"as_of":"2026-08-11T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dec57a5cba63a44850067b15a86f12bbe6311e92ab9e4bdf3ade27e2c3f29133","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:37:02.239371Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:15:08.304150Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.742775Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.17842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17842","snapshot_observed_at":"2026-07-04T07:59:40.742775Z","title":null,"venue":null,"work_id":"963aad47-57a2-40cb-9fec-07c071fcd674","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2501.17842","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:6293123015722852993cc3b45d0e8d38724f778f5c614e965bfce482fbc015dd","observation_id":"bad41099-7891-40e3-b218-6fc159836bcf","resolution":{"observed_at":"2026-07-04T07:59:40.744288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.17842/citation-record","integrity":"/paper/2501.17842/integrity","json":"/paper/2501.17842/citation-record.json","paper":"/paper/2501.17842"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.739659Z","title":"Critical learning periods in deep networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.739659Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:3662ba6954d231cf10d6f84afc13f65a5bf080855683a1d9837a435646c81391","observation_id":"1a0e42ae-21d7-4791-931a-3b14104fb482","resolution":{"observed_at":"2026-08-10T04:37:01.739659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.746313Z","title":"Learning dexterous in-hand manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.746313Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:4fbf5bbba2fc0bf10a85b4f7112c62d9fcb61cd6141646b21f60b328d874bb51","observation_id":"95c0459c-a4a2-465e-a229-43ca501811ef","resolution":{"observed_at":"2026-08-10T04:37:01.746313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06976","last_updated":"2019-11-19T14:40:14Z","snapshot_observed_at":"2026-07-06T08:15:23.057129Z","submitted_at":"2019-08-19T16:22:20Z","title":"A survey on intrinsic motivation in reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06976","snapshot_observed_at":"2026-08-10T04:37:01.752309Z","title":"A survey on intrinsic motivation in reinforcement learning","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.752309Z"},"links":{"cited_paper":"/paper/1908.06976","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:7e6b70c04197770a85c7c126de26c0fda74b722269f26f3840c8a63c449aa257","observation_id":"9dd481e3-8c47-4a4f-99de-30193bbc9e40","resolution":{"observed_at":"2026-08-10T04:37:01.752309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06038","last_updated":"2020-02-14T13:57:22Z","snapshot_observed_at":"2026-07-06T08:57:20.804732Z","submitted_at":"2020-02-14T13:57:22Z","title":"Never Give Up: Learning Directed Exploration Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06038","snapshot_observed_at":"2026-08-10T04:37:01.760052Z","title":"Never give up: Learning directed exploration strategies","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.760052Z"},"links":{"cited_paper":"/paper/2002.06038","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:da19b4b0d3cf9dffe9fae92d9e5e99132b7e54cf882da959f2f0899657fae589","observation_id":"7e99525c-3df7-406f-896d-d4c77bf09dc6","resolution":{"observed_at":"2026-08-10T04:37:01.760052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.615898Z","title":"Toddler-inspired visual object learning","venue":null,"work_id":"ada30965-7d72-413e-8a2d-f7a414bf9806","year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.766890Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:84b5b989b743ac5ba1bc04219b41821dc47b3d79ab389e6bc3a50f14693dc7e0","observation_id":"d648ce7f-df74-4c50-a0d5-e3901ce83a42","resolution":{"observed_at":"2026-08-10T04:37:03.620991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.599157Z","title":"Curriculum learning","venue":null,"work_id":"cee5aeb5-a7db-45b5-998c-e70495bfecac","year":2009},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.774882Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:4a90d27248a1875a52e91cfd965a09063a31f568624973ec5aae610c9579929f","observation_id":"65f96382-5527-4618-a2c7-8ade189ce4f1","resolution":{"observed_at":"2026-08-10T04:37:03.604620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T04:37:01.781050Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.781050Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:239ba6020486204b55098ec4ecadfc61abaef8a3368766f206b69d77b4c56372","observation_id":"2566d5af-ecf6-402e-a52d-a80ef319f9b9","resolution":{"observed_at":"2026-08-10T04:37:01.781050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-10T04:37:01.787185Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.787185Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:e8bb965dd8a9f7c4e610a8c888f145c5dc8caedd77ffd3787f0a6bd88031d4f1","observation_id":"95bee900-f074-4859-9416-29d67b4665e0","resolution":{"observed_at":"2026-08-10T04:37:01.787185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.582057Z","title":"A critical period for robust curriculum-based deep reinforcement learning of sequential action in a robot arm","venue":null,"work_id":"2a50ab26-a7d7-4369-8deb-6f466085ada8","year":2022},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.794058Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:7afbdac107113dc7a3853ae0a8b9cd6dd57ee41a10e2e6643483a446039b5ebe","observation_id":"b70eef33-a63e-484f-9bff-a45998d7e0fc","resolution":{"observed_at":"2026-08-10T04:37:03.587524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.564891Z","title":"Class rectification hard mining for imbalanced deep learning","venue":null,"work_id":"afdaa9a3-c353-47ac-95d2-efc6d282cb05","year":2017},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.799597Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:738f32dcba8642b104c231df28968eae24a89cfa2637c2ee6ecd4acb50abd1aa","observation_id":"915198f8-8bbf-4e04-b03c-201fd8ee75b0","resolution":{"observed_at":"2026-08-10T04:37:03.570077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.805366Z","title":"Self-contrastive learning with hard negative sampling for self-supervised point cloud learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.805366Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:8c2cf02bd86e4d4b467fd2d5505222dc3493c1bb7c86b447ad4c5ce9982af7e1","observation_id":"f5646f98-1f35-4a8b-bc16-fbacb3d00ff9","resolution":{"observed_at":"2026-08-10T04:37:01.805366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.547780Z","title":"Automatic goal generation for reinforcement learning agents","venue":null,"work_id":"31c7d252-2da7-47ff-804d-f605b849a086","year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.810267Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:3acc44204ca0e6c470041b551321a4fb3c0e67a35866c64a1b054e10e462dc4b","observation_id":"218cc5a5-0000-49d9-a628-47ec6a2704d2","resolution":{"observed_at":"2026-08-10T04:37:03.553506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.529840Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":"9e5b10e9-e294-42e8-b15b-eac990c1e89c","year":2021},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.816162Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:92ca74357fef6831dec5750489f99707858daaa3f6923fc22a3b40d3ff3f1ce8","observation_id":"84a96359-289a-4d61-bd5e-3a150cc4a11c","resolution":{"observed_at":"2026-08-10T04:37:03.535508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.512533Z","title":"Exploratory behavior in the development of perceiving, acting, and the acquiring of knowledge","venue":null,"work_id":"20af0d70-a6fc-4bf1-ba12-a30a255d783e","year":1988},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.821217Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:34183c5498e6fde93114478933afaa0f044d17b0837f91acd920fe417570d6d9","observation_id":"0fc64829-8eb4-457d-a1af-cfd44bd92237","resolution":{"observed_at":"2026-08-10T04:37:03.518317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6544","last_updated":"2015-05-21T21:44:31Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T21:55:01Z","title":"Qualitatively characterizing neural network optimization problems","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6544","snapshot_observed_at":"2026-08-10T04:37:01.828345Z","title":"Qualitatively characterizing neural network optimization problems","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.828345Z"},"links":{"cited_paper":"/paper/1412.6544","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:521784ca014212c813a7455ddf68d125f58606ec0d35548b23da49fad571cb22","observation_id":"0e2f4b8c-b6f7-4732-bd8e-896e135c38fc","resolution":{"observed_at":"2026-08-10T04:37:01.828345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.494102Z","title":"The scientist in the crib: Minds, brains, and how children learn","venue":null,"work_id":"a007cd99-ae8e-4e82-9313-78a3d35f9a70","year":1999},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.834222Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:27fd094858274773d36e68cb0f6629f8d06675033ee220946cb5b6464138b03d","observation_id":"3d3c6b86-58c7-4989-bb18-16d15ba4cec7","resolution":{"observed_at":"2026-08-10T04:37:03.500009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.476572Z","title":"Changes in cognitive flexibility and hypothesis search across human life history from childhood to adolescence to adulthood","venue":null,"work_id":"da6d1128-7fe8-473c-a7f9-d8dc26136cc1","year":2017},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.839444Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:7cb03350391acab75f07824339c3e7ae1313aa64ea85d749dcc7be5a5418c397","observation_id":"55b368b1-6db1-4525-b3fb-5de18650d1cd","resolution":{"observed_at":"2026-08-10T04:37:03.482204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.459123Z","title":"Automated curriculum learning for neural networks","venue":null,"work_id":"24efcc0d-b762-4997-b9ba-aee04f05fe0c","year":2017},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.844547Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:ef171313bdd65dfc7a78182688a8f19a07a2301b79981367addc272d4f2242fa","observation_id":"202da60a-af40-4e8b-af47-ef38ccc6c3e3","resolution":{"observed_at":"2026-08-10T04:37:03.465050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.849912Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.849912Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:1e9647ac250f3c6f90c916b3403bc40a5fe620e5c3d282ce947dfe877f6c8f62","observation_id":"0061575f-658f-4225-b700-bc81de7be184","resolution":{"observed_at":"2026-08-10T04:37:01.849912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.426282Z","title":"On the power of curriculum learning in training deep networks","venue":null,"work_id":"e4896ef5-3c23-4c45-87e8-5c6d85d155e7","year":2019},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.855034Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:e91d0fe454241e380fdba4baa3311600875a3b12a872bf633b09a9d800fd6a5a","observation_id":"c09b2fce-b3d0-4755-809b-1c130020064a","resolution":{"observed_at":"2026-08-10T04:37:03.431908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09281","last_updated":"2019-11-11T14:18:31Z","snapshot_observed_at":"2026-08-10T03:26:07.679228Z","submitted_at":"2019-10-21T12:06:28Z","title":"Dealing with Sparse Rewards in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09281","snapshot_observed_at":"2026-08-10T04:37:01.861960Z","title":"Dealing with sparse rewards in reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.861960Z"},"links":{"cited_paper":"/paper/1910.09281","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:b40b9987f269d2e3115787f609e4d6fb62e13eb46fe5ceb55c2de09413a54ca3","observation_id":"bfb38035-4bbb-48cc-85b1-f078aa19bae0","resolution":{"observed_at":"2026-08-10T04:37:01.861960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.409510Z","title":"Expressing arbitrary reward functions as potential-based advice","venue":null,"work_id":"e0f5f320-3a7c-4d60-bc34-6a9a8867ad64","year":2015},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.869271Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:710dd21d9047d6f77cc6d668aa0b95a8ae29d1325ad9063e62d96e35e41598c2","observation_id":"3221bf7a-5b74-4e77-952a-b02bca32e2e2","resolution":{"observed_at":"2026-08-10T04:37:03.414732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.389993Z","title":"Comprehensive overview of reward engineering and shaping in advancing reinforcement learning applications","venue":null,"work_id":"b1c33bf3-2bb0-4731-9249-e2eaf5a34c5a","year":2024},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.875305Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:211e00402539f9b0e3a1ea7468790d0b0e4f7052971483b7e4986ec23c4bce0d","observation_id":"de85f9db-3569-4201-81f3-3c6b661d49ff","resolution":{"observed_at":"2026-08-10T04:37:03.397635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.372249Z","title":"Finding flatter minima with sgd, 2018","venue":null,"work_id":"f967245e-1415-4069-9bf4-efdbb218efbf","year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.882211Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:e90b6162c69908e53df1349d46f64510751eab466af688d38c2440282fb703d4","observation_id":"55b4ce60-6fee-4916-8798-9866b732270a","resolution":{"observed_at":"2026-08-10T04:37:03.377585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.355100Z","title":"Hard negative mixing for contrastive learning","venue":null,"work_id":"593dc41b-f512-42d2-ba91-cb0fd487eae2","year":2020},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.889915Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:1096e8483423ce459041436a778b833ffa0f39724c127969e87c00baf4d989bc","observation_id":"329ac9c2-6788-471c-b331-e90037ecfeba","resolution":{"observed_at":"2026-08-10T04:37:03.360854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.894875Z","title":"Vizdoom: A doom-based ai research platform for visual reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.894875Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:f51f6c6a6721c4a22cbd6f2a7492d38fb6ffd91f95188f89e5dd8abd0f99a9cc","observation_id":"7e9585ef-5542-430e-b4d2-cf52bfbda266","resolution":{"observed_at":"2026-08-10T04:37:01.894875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-10T04:37:01.899981Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.899981Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:b32210e505a2595ba7ba5ffe87551b4a4fca2638ee0bff58d6c3fbb6d83e88ad","observation_id":"2c376e58-dea9-4c00-a18c-2798bea7406e","resolution":{"observed_at":"2026-08-10T04:37:01.899981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.318511Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":"94b7a798-4c2e-4cbf-9fdd-95b67fe0faa6","year":null},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.905558Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:c32fd58569f93d4538770211593963750340e2014141062e9bc78e00dbc4469a","observation_id":"2339c1f9-fe19-469e-b2d4-7ba67b75e7c6","resolution":{"observed_at":"2026-08-10T04:37:03.324828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.273639Z","title":"Goal-aware cross-entropy for multi-target reinforcement learning","venue":null,"work_id":"8d529946-8990-4bfb-99af-34ff97db4663","year":2021},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.916395Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:b4bde65f22fd733fb61a5b0f2296c8b3398fe3732aaceb2ae31e2afb523ea97a","observation_id":"6c5cbfdf-b4cf-4327-a519-d0155edcd1ae","resolution":{"observed_at":"2026-08-10T04:37:03.280366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13741","last_updated":"2023-05-23T06:51:51Z","snapshot_observed_at":"2026-08-05T01:33:59.756384Z","submitted_at":"2023-05-23T06:51:51Z","title":"L-SA: Learning Under-Explored Targets in Multi-Target Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2305.13741","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13741","snapshot_observed_at":"2026-08-10T04:37:02.429552Z","title":"L-SA: Learning Under-Explored Targets in Multi-Target Reinforcement Learning","venue":"cs.LG","work_id":"0efa167a-cf6f-454f-8925-6693845c6b2d","year":2023},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.921280Z"},"links":{"cited_paper":"/paper/2305.13741","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:9147437856959e8c64984475aa87a5579d07195ddb2b7d71b35d70f99d973d5f","observation_id":"04386915-3dd0-459a-a63e-06dce0ffa9de","resolution":{"observed_at":"2026-08-10T04:37:02.435838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03446","last_updated":"2023-12-05T05:34:12Z","snapshot_observed_at":"2026-08-10T18:52:27.988856Z","submitted_at":"2023-12-05T05:34:12Z","title":"Visual Hindsight Self-Imitation Learning for Interactive Navigation","version":1},"cited_work":{"arxiv_id":"2312.03446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03446","snapshot_observed_at":"2026-08-10T04:37:02.397099Z","title":"Visual Hindsight Self-Imitation Learning for Interactive Navigation","venue":"cs.AI","work_id":"78ebe3ed-f94d-404c-afe0-11e179312991","year":2023},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.926810Z"},"links":{"cited_paper":"/paper/2312.03446","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:b1a996fa166f456a6f4dd9d76483c937c2dede921d507e4b8f6da97821b76f29","observation_id":"6cbd135b-887d-46d3-ab64-5bd6289b57b4","resolution":{"observed_at":"2026-08-10T04:37:02.407567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.933335Z","title":"Reward (mis) design for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.933335Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:e2d28bd67b1d50f4b25fe05d06dd3caeb71a42b80be145d726a70277f6f1c606","observation_id":"9cfc33a3-154e-4075-a9fe-c0d5fbeddf36","resolution":{"observed_at":"2026-08-10T04:37:01.933335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.234653Z","title":"Exploration in deep reinforcement learning: A survey","venue":null,"work_id":"c8cd9749-5fd9-416d-a634-59b4272a4f83","year":2022},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.939931Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:a7ed8fe4f729d7c917182fc1624430c2eb004ddf1e47550d90051ed210fe38a2","observation_id":"1a1fb464-a246-4375-aec4-0f20a0a8cf67","resolution":{"observed_at":"2026-08-10T04:37:03.244945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.211101Z","title":"Theory and application of reward shaping in reinforcement learning","venue":null,"work_id":"25c2ef4e-4a2d-4a92-a25f-c205f6fd04e2","year":2004},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.945596Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:e4fc43080f5be2d10815c56fa18f8284cad5e51ae75204bb9acd37457622dc9a","observation_id":"ed9c321e-01e8-4573-a784-069762bf7b50","resolution":{"observed_at":"2026-08-10T04:37:03.217213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.951105Z","title":"Visualizing the loss landscape of neural nets.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.951105Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:a480d0a5383bf75964bdee4eb82a76ee2e5df71fa6f6209500c23638739519a7","observation_id":"e0839428-7a16-4cde-9b54-4ad5c0550fb4","resolution":{"observed_at":"2026-08-10T04:37:01.951105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.167478Z","title":"Continual reinforcement learning in 3d non- stationary environments","venue":null,"work_id":"3feda52e-9225-41be-baf4-96a124528993","year":2020},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.962869Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:9f3102707d8f1a9c235c86d921b222748e2972fe63780015357b81ad81d05c5e","observation_id":"87f954d8-2606-4997-b33a-cc02cef768a4","resolution":{"observed_at":"2026-08-10T04:37:03.173903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.146929Z","title":"Information-based objective functions for active data selection","venue":null,"work_id":"90128e7e-0715-49f2-b7bf-91400288d7c1","year":1992},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.968890Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:0a5638708b4cab99520eab03e4028eed1841045e640c8fec2d5518ff40f6f409","observation_id":"f65ea873-5742-4f77-9b01-ab806b08bc78","resolution":{"observed_at":"2026-08-10T04:37:03.153141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-10T04:37:01.976047Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.976047Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:57b8e971eaf5585f93923377f59d6926dd3d468556d14afff4f9676acfecbf2d","observation_id":"1feb27b2-ee35-4b99-8dd9-d4e4be6d5500","resolution":{"observed_at":"2026-08-10T04:37:01.976047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:01.981923Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.981923Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:1cb2a48d19808f138d5d9d5368e0fec49ad36c02d258259e031266567b8b0f60","observation_id":"5d951831-c388-49d0-ac77-eda90a41b493","resolution":{"observed_at":"2026-08-10T04:37:01.981923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.129328Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"59ff88f5-4d95-43ba-80b1-790c0ef3c206","year":1928},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.988468Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:c605111e76e42582ca69624cbb6be7d5b5a3f42faecd207dae15e1a1c85466ac","observation_id":"72f4ae6d-b28d-47a3-a670-c8af144f8283","resolution":{"observed_at":"2026-08-10T04:37:03.135109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.112546Z","title":"Generalizing curricula for reinforcement learning","venue":null,"work_id":"a3311642-a1ca-477f-bca9-8d9e31d620e1","year":2020},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.996467Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:b5ef3d36d6cf7630b3118d606b5d09f4c64b4b0b4100055ecf1a3bdb33d094cc","observation_id":"c673ddb6-2ad3-4664-b345-4f759ac75097","resolution":{"observed_at":"2026-08-10T04:37:03.117560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.095434Z","title":"Ng, Daishi Harada, and Stuart J","venue":null,"work_id":"efc5bd72-5ca8-4c15-9f4c-e6332453c288","year":1999},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.001571Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:cbf5916a74d3925d698bcd5855d6f5968159dee74d20ae31f2be1116bf2c6523","observation_id":"94bb4d39-cc78-4fda-aac4-107954a11654","resolution":{"observed_at":"2026-08-10T04:37:03.101108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.073136Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"3be81df3-dcd1-40bf-a3fe-263d6721f03e","year":1999},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.006759Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:e0b97dff0c905c95d389af9b48bea22da3bf069bd3622269f4043b8aa9e27f10","observation_id":"377bf4d5-35aa-4735-a371-6ae1c7992d08","resolution":{"observed_at":"2026-08-10T04:37:03.080041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.055073Z","title":"How evolution may work through curiosity-driven developmental process","venue":null,"work_id":"77ff8b09-0558-4c0d-a8d5-8abf21e66575","year":2016},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.011672Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:2b7ed939b622f9721682803b3dab68a0493ca8e24f4f62745919cd87a61591d1","observation_id":"9750cda7-d33f-4743-aadc-63646e131db2","resolution":{"observed_at":"2026-08-10T04:37:03.061401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.031469Z","title":"Benchmarking multi-agent deep reinforce- ment learning algorithms in cooperative tasks","venue":null,"work_id":"b04e1d93-e19c-4dc6-bba5-50727a3fd2f5","year":2021},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.016440Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:5b508326a469cdda57b66c6d01d4b360556a249166801b2b279e801ca26c7c61","observation_id":"06b8e9db-e691-4cd8-8c09-5e9a7dd77f54","resolution":{"observed_at":"2026-08-10T04:37:03.037321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.011836Z","title":"Toddler- guidance learning: Impacts of critical period on multimodal ai agents","venue":null,"work_id":"16208efa-22b7-4571-b3b5-260a646ef4e9","year":2021},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.021482Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:5b57707441a11f91770145ac2214e37c979555b8bb9d8034fa5eece2155ef8ab","observation_id":"c6871958-9ad0-4323-81bd-43e01ea9fd19","resolution":{"observed_at":"2026-08-10T04:37:03.017617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.993367Z","title":"Unveiling the significance of toddler-inspired reward transition in goal-oriented reinforcement learning","venue":null,"work_id":"ff4ec555-3ec0-4e2b-b4fc-15c23d0d8ac2","year":2024},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.026176Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:5dacd9c3e4cd00e158973756a99f708fbddc3342eec2f283e33d68e61aa8ca6d","observation_id":"6077acab-c7df-4869-9b9f-d37645447845","resolution":{"observed_at":"2026-08-10T04:37:02.998943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.162181Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.162181Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:878df14b44d93197fb683c9bfe5360d629a90f8110cf20cca4acbb824104b486","observation_id":"b7070522-7609-4216-8302-a2d98747092a","resolution":{"observed_at":"2026-08-10T04:37:02.162181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.961178Z","title":"The origins of intelligence in children, volume 8","venue":null,"work_id":"27b6b0b3-0f83-48c8-85e4-f7ac176eaf19","year":1952},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.169483Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:a875886960c028f5815200e4b15925bd56da6aa702a2e380122000390708ccbb","observation_id":"c2ffe56c-122d-4b58-b0a0-010e640df1e3","resolution":{"observed_at":"2026-08-10T04:37:02.967628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.942175Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":"f59002bf-0451-418c-a7e8-870df5c1249f","year":2021},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.174900Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:76f2f1ce5a792b3114626b1c0f8627944ef8f8e0aa9eb76a2ee789e38314be59","observation_id":"b6ff1b5d-d3a6-4afb-aa5a-3a54ee8fe99d","resolution":{"observed_at":"2026-08-10T04:37:02.949208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-10T04:37:02.180292Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.180292Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:d2df2a63d4da316bd499a5a9b491ce12c60692b2f1b401474c151d3cd98fdd18","observation_id":"5084a7dd-85d9-43fc-9f72-c400a3afb3eb","resolution":{"observed_at":"2026-08-10T04:37:02.180292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T04:37:02.188868Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.188868Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:4f812bfa480abaa879d2ae12529d3c0a2ac805029cc6ef09fc46ad5142d399e2","observation_id":"31e1cd85-c28b-42c0-ba50-c01527ca47b1","resolution":{"observed_at":"2026-08-10T04:37:02.188868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.919375Z","title":"From neurons to neighborhoods: The science of early childhood development","venue":null,"work_id":"22bb694d-f791-4fdc-8860-7a75fa840864","year":2015},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.194726Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:31482049db4aebfe45681b52c601ce88c5e6dddc0251b4479b2e466d4fcce942","observation_id":"235e6a0c-5ad7-4fb6-ab1d-7ed47b1f8a01","resolution":{"observed_at":"2026-08-10T04:37:02.927361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.895656Z","title":"Transfer learning for reinforcement learning domains: A survey","venue":null,"work_id":"c58c5430-8b38-4a8d-aa22-185776673e54","year":2009},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.201237Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:c1370ac44befdb6e1d90b9d5e4ccbf384265c5ed961b73e9b94d1459d391a98f","observation_id":"ff5afa0c-e470-492c-8ab2-95fc416d62e6","resolution":{"observed_at":"2026-08-10T04:37:02.901494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.207964Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.207964Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:c5d61b7df1d32a883aca0b4bbf00787fd77d15e329e0de1ab9cfaa12edb3e36b","observation_id":"b009c179-2eed-4b14-9a0c-4ac844f40e5a","resolution":{"observed_at":"2026-08-10T04:37:02.207964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.213320Z","title":"Cognitive maps in rats and men","venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.213320Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:12fdd8eec93eebd84cde88f74b84b67acbaae79a8e27f7724b2258df751ec33e","observation_id":"77112c7c-156b-40d2-a2ee-96e7b1ea909d","resolution":{"observed_at":"2026-08-10T04:37:02.213320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.850125Z","title":"Safe reinforcement learning via curriculum induction","venue":null,"work_id":"f50d5a62-8022-4e67-97d0-38a4f9978a10","year":2020},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.218907Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:cb2b46b33c4de5f3ffa64db3bc1995ebd12d285597b75566f2483118ca43f34d","observation_id":"ef495413-98ac-48f6-936f-c606bff9f49b","resolution":{"observed_at":"2026-08-10T04:37:02.857730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.824796Z","title":"Curriculum learning by transfer learning: Theory and experiments with deep networks","venue":null,"work_id":"94aab023-4125-4d7c-9ce0-4b4c1332dbb8","year":2018},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.224897Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:bd5a7a90d7e4c9fddfc97961109bf343d357cc032b6dd81c68444148e89f5e50","observation_id":"bfd574d5-3452-412d-88c0-0fa1215993a4","resolution":{"observed_at":"2026-08-10T04:37:02.830977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06781","last_updated":"2020-01-19T06:07:20Z","snapshot_observed_at":"2026-08-09T11:18:20.787680Z","submitted_at":"2020-01-19T06:07:20Z","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06781","snapshot_observed_at":"2026-08-10T04:37:02.231133Z","title":"Fresh: Interactive reward shaping in high-dimensional state spaces using human feedback","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.231133Z"},"links":{"cited_paper":"/paper/2001.06781","citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:6e9ad2ac0473dea226db6d691def9233feb3c22baf8b3a51af17961705b1e769","observation_id":"156d6535-e62d-4ad4-b6ed-8181b30129fc","resolution":{"observed_at":"2026-08-10T04:37:02.231133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:02.800347Z","title":"requested","venue":null,"work_id":"1ca8d174-5a0e-435a-aa1d-500bb2af8824","year":1994},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:02.239371Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:439e367db6236250fcf815bfbc7fd009ee6adf3b91c4cc17df6a78ae7aa424a0","observation_id":"f1382a11-bbd9-438a-ae39-12fa51c4fe03","resolution":{"observed_at":"2026-08-10T04:37:02.808327Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T04:37:03.296797Z","title":null,"venue":null,"work_id":"59f1d2b4-fdde-40e5-a467-e306d611e413","year":null},"citing_paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:01.911304Z"},"links":{"citing_paper":"/paper/2501.17842"},"observation_digest":"sha256:222d6595aaea534a47c1ae2a1ab22b4f253a021216b2428158ad9c18953473a4","observation_id":"c24ef4d4-4270-44ea-8186-0e0c11f39a48","resolution":{"observed_at":"2026-08-10T04:37:03.305336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.17842","last_updated":"2025-01-29T18:46:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T16:48:05.949256Z","submitted_at":"2025-01-29T18:46:35Z","title":"From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2501.17842."}