{"as_of":"2026-08-07T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:885fd982c55362e09b1670a6eb4ed8d0d014269042c0d73460e8b64b98649b72","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:40:59.125143Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:12:29.063618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01919","snapshot_observed_at":"2026-08-02T10:12:29.063618Z","title":"Transformers as multi-task learners: Decou- pling features in hidden markov models.arXiv preprint arXiv:2506.01919, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22646","last_updated":"2026-06-24T17:42:19Z","snapshot_observed_at":"2026-08-04T12:15:37.636193Z","submitted_at":"2026-06-24T17:42:19Z","title":"Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T10:12:29.063618Z"},"links":{"cited_paper":"/paper/2506.01919","citing_paper":"/paper/2607.22646"},"observation_digest":"sha256:99067cb812bccab4f2bb8da039c73c667742283ba9834c074ae2baad1975dfd8","observation_id":"ed003c3e-4a09-4780-9dd9-fc76dc6516a7","resolution":{"observed_at":"2026-08-02T10:12:29.063618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01919/citation-record","integrity":"/paper/2506.01919/integrity","json":"/paper/2506.01919/citation-record.json","paper":"/paper/2506.01919"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:40:12.667810Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:12.667810Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:91eca05f723ae5ee93d4f91f4ef85e8cfd2ca5b8226194ecd1bee1375a472738","observation_id":"b37cdf96-cab3-43d4-9850-c902584a7c54","resolution":{"observed_at":"2026-08-07T11:40:12.667810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.492576Z","title":null,"venue":null,"work_id":"e6ea94b8-30fb-40c2-9af3-4845112868d0","year":2020},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:23.082855Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0a3c15c0782af08673d7d1ab8f5dbf00c78ef92e30379a453261a80317f9c97f","observation_id":"2776fbb9-3174-4dd5-a944-291bb90654cf","resolution":{"observed_at":"2026-08-07T11:41:14.576099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-07-06T14:24:05.948664Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-07T11:40:23.398864Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:23.398864Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:e0639f34bfdc1bbe76c24795d9c86af455cf9417eff17698929a0ff7c15cb8ce","observation_id":"9e33608f-18f7-45d9-9f4e-1fa306a3e8bc","resolution":{"observed_at":"2026-08-07T11:40:23.398864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:23.658854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:23.658854Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:9a4c5685904935b5f12770613c1ecedb28a14fb8f719c70b54ea28f86b582b1f","observation_id":"de0af1fd-b6c7-47bf-80d8-0f98468a9cb7","resolution":{"observed_at":"2026-08-07T11:40:23.658854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.304337Z","title":null,"venue":null,"work_id":"0d4ff5e2-b4bf-46bc-a28d-780c1d8bd1af","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:24.130942Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:b86f9bf8e1482f8e96eb75d1d115d03ba350b1781d84c677ee5d17c6973e1fd8","observation_id":"bb355573-f35e-4bbf-9f23-d86137c98bd3","resolution":{"observed_at":"2026-08-07T11:41:14.394357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.152991Z","title":null,"venue":null,"work_id":"cfb89e6d-e1b5-4f66-ad72-6b85f83dfa64","year":1967},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:31.436082Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:c49580308928b0fea3fe3ae1c49578830427a223c64b077a9ed9b46181e8c50b","observation_id":"5c47feb1-a624-4b5a-8b6a-7963b64d22c2","resolution":{"observed_at":"2026-08-07T11:41:14.225147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:32.879319Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:32.879319Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:07cfd3bb76b52bd6e9d43f9b53b81431b3e5b052468e7692805f6d6b117b73f9","observation_id":"055ae442-6429-4ada-b088-70b6f7c76574","resolution":{"observed_at":"2026-08-07T11:40:32.879319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.939498Z","title":null,"venue":null,"work_id":"3e11db6c-35f1-490e-b501-88375e0edcab","year":2021},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:34.930815Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:4ae53ea5cc0b927f500762f3ea32cc5963d966991ce8fdd59059d013dc8ae29f","observation_id":"693a0ccf-5081-41c1-97cc-3ab3f968d44d","resolution":{"observed_at":"2026-08-07T11:41:14.017424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10559","last_updated":"2023-05-15T11:45:12Z","snapshot_observed_at":"2026-08-04T19:53:52.631474Z","submitted_at":"2022-12-20T18:58:48Z","title":"Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10559","snapshot_observed_at":"2026-08-07T11:40:35.806691Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.806691Z"},"links":{"cited_paper":"/paper/2212.10559","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:c246e75057735bb1d0dd6b9aa59706ffdf919023484b7bdd3ee8a4336556fd86","observation_id":"37303a8d-8c66-443b-b845-98f7ab01a44b","resolution":{"observed_at":"2026-08-07T11:40:35.806691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00507","last_updated":"2019-05-15T18:01:40Z","snapshot_observed_at":"2026-07-06T07:49:49.832958Z","submitted_at":"2019-05-01T21:29:14Z","title":"Learning higher-order sequential structure with cloned HMMs","version":4},"cited_work":{"arxiv_id":"1905.00507","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00507","snapshot_observed_at":"2026-08-07T11:40:59.887908Z","title":"Learning higher-order sequential structure with cloned HMMs","venue":"stat.ML","work_id":"cbbd8d63-ca72-46b8-aaf6-888c90135492","year":2019},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.917029Z"},"links":{"cited_paper":"/paper/1905.00507","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:3c02d9e18d921c029f817ff64bf2e5dde5558f825a0cb4c3fce052211f414042","observation_id":"16078ba0-f8ee-4248-88a5-e724faf3065b","resolution":{"observed_at":"2026-08-07T11:40:59.940388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T11:40:35.988583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:35.988583Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0830a62bf752a5feffd1d51b833f33446a88679a64fb2dce8630eeeb8fe7b4a4","observation_id":"6639830b-7776-4d2c-ab1b-dd86daaf804a","resolution":{"observed_at":"2026-08-07T11:40:35.988583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:40:36.043974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:36.043974Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:4cbe79e4d282a41be5bce3b3c0fcda5ce89fde3b7d3720e00beaa7e0b3f02caf","observation_id":"856b3693-b88d-428b-8f3b-c6f6e6f6f7f8","resolution":{"observed_at":"2026-08-07T11:40:36.043974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13180","last_updated":"2023-11-24T18:31:21Z","snapshot_observed_at":"2026-07-06T16:50:58.750467Z","submitted_at":"2023-11-22T06:06:54Z","title":"Provably Efficient High-Dimensional Bandit Learning with Batched Feedbacks","version":2},"cited_work":{"arxiv_id":"2311.13180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13180","snapshot_observed_at":"2026-08-07T11:40:59.706089Z","title":"Provably Efficient High-Dimensional Bandit Learning with Batched Feedbacks","venue":"stat.ML","work_id":"c5e4d322-480d-4cf5-afaf-aec2567760b3","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:36.102914Z"},"links":{"cited_paper":"/paper/2311.13180","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:dd31d3399654274053102d801e184803cce8f3db6fc1e2004eac246c9b794f6f","observation_id":"85af8bd4-a4d9-4667-8b5c-42a18f74b032","resolution":{"observed_at":"2026-08-07T11:40:59.778041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.769189Z","title":null,"venue":null,"work_id":"8177f8d7-a05a-4f9f-b63c-f3e3a5860e2d","year":2003},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:46.567180Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:46e86bebdebb6cd42d67e039528ecbbd4c73b994f2c5c1768567765535dd49b0","observation_id":"dc45da97-be6b-4d0e-ad80-1602fce61a2a","resolution":{"observed_at":"2026-08-07T11:41:13.864748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:53.229870Z","title":"S., and Valiant, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:53.229870Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:fe0153c1158c4b3d47472b2e1d0f1ffe49d23291812687a1fd54bdfb688ec7a9","observation_id":"ce7fccea-3bfa-412f-9872-5f705a1749dc","resolution":{"observed_at":"2026-08-07T11:40:53.229870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.649705Z","title":null,"venue":null,"work_id":"d7e8c595-9c7d-41ed-8477-43865710541d","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:54.881823Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:bc9f73fd4353b831627656b124847e603673252e9381bdb29d1713ffa981a19f","observation_id":"748cf294-8c43-46f6-b1b0-115609ca86c8","resolution":{"observed_at":"2026-08-07T11:41:13.682483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10616","last_updated":"2023-10-16T17:40:49Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:40:49Z","title":"How Do Transformers Learn In-Context Beyond Simple Functions? A Case Study on Learning with Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10616","snapshot_observed_at":"2026-08-07T11:40:55.541675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.541675Z"},"links":{"cited_paper":"/paper/2310.10616","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:c41ce7cb748da615179c24e187d403c9affc0dc733480879961f9bccf861baf7","observation_id":"371d5abd-36dd-454a-a5e3-c3930026e809","resolution":{"observed_at":"2026-08-07T11:40:55.541675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.468173Z","title":"L., Fard, M","venue":null,"work_id":"2865ad20-8859-4ed8-a550-131667804b95","year":2013},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.869665Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:452d13f7952af5d6a37104d482f8ebf16ec45603f65411b287b07be0ccac264d","observation_id":"e6110633-2700-40ad-8141-d7ab93d2bfb0","resolution":{"observed_at":"2026-08-07T11:41:13.576491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.240867Z","title":"M., and Zhang, T","venue":null,"work_id":"7e278bb7-53de-433d-a939-5ca628d64e23","year":2012},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.913905Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:d039bf4a8bf488703dc6ba0d39edf50d1c4374277b0a64423fb827b6f7ac0da7","observation_id":"c6a0104b-e2a7-4746-a357-8b40f9b81dc6","resolution":{"observed_at":"2026-08-07T11:41:13.334479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09960","last_updated":"2023-09-13T18:52:02Z","snapshot_observed_at":"2026-07-06T15:17:41.309684Z","submitted_at":"2023-04-19T20:45:01Z","title":"A Latent Space Theory for Emergent Abilities in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09960","snapshot_observed_at":"2026-08-07T11:40:55.929001Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.929001Z"},"links":{"cited_paper":"/paper/2304.09960","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:337c2630f17990ddfae52eeaa4d139aab6c8f121623829c990f04bf09d7f16ec","observation_id":"04cfe5c6-48d7-47bf-9ad2-f2da8a8e07b9","resolution":{"observed_at":"2026-08-07T11:40:55.929001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.028586Z","title":null,"venue":null,"work_id":"2f397e17-f267-4452-bfe1-0473055c3948","year":2015},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:55.994873Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:1506c503f1bd54d53b5bf6ae1c5390919bd303c434489656b5fdd1645b46dcbe","observation_id":"9667b24a-9dc6-4a70-8616-4d08a9a512a1","resolution":{"observed_at":"2026-08-07T11:41:13.149079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08566","last_updated":"2024-05-26T04:55:19Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:55:02Z","title":"Transformers as Decision Makers: Provable In-Context Reinforcement Learning via Supervised Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08566","snapshot_observed_at":"2026-08-07T11:40:56.046409Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:56.046409Z"},"links":{"cited_paper":"/paper/2310.08566","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:b32a4920c3766238c7f1b995d67d09ce4c0731029ee8f08212f1e733c9635927","observation_id":"50c28daa-a967-4087-85c5-2fc111ff7716","resolution":{"observed_at":"2026-08-07T11:40:56.046409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:40:57.515045Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.515045Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:1098aef33962e48b9dbb8466478fa536e67264e09991da4ebbb57b2ca2ded63f","observation_id":"890197f7-e19f-432c-91dc-9beb7e6903c1","resolution":{"observed_at":"2026-08-07T11:40:57.515045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-05T14:55:09.743440Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-07T11:40:57.702995Z","title":"T., Goel, S., Krishnamurthy, A., and Zhang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.702995Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:7630b1e772013963a02d1283e3981b8d91d3f6191cb92062f85653c6e40c090b","observation_id":"5bae81ac-d125-41e9-bf4f-39ce966d6004","resolution":{"observed_at":"2026-08-07T11:40:57.702995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.798671Z","title":null,"venue":null,"work_id":"9f70b22c-92c4-4419-8814-0fae567f528e","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.754927Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0994fc08bed1d7b3b322112e898eaffc9cca1f2d7ae15296b091507b0ff71820","observation_id":"06255387-f9d0-473d-b2c2-6b5e540c3c44","resolution":{"observed_at":"2026-08-07T11:41:12.925106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-07-06T15:51:28.002438Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-08-07T11:40:57.792547Z","title":"B., and Ma, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.792547Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:eff5dcef486cad4ec2259553b978ed9a4f13bbbfd567ff9b71d19ee170537dd8","observation_id":"fe0c9757-5b8e-414f-9857-a3e00522e994","resolution":{"observed_at":"2026-08-07T11:40:57.792547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.584055Z","title":null,"venue":null,"work_id":"b9cb8ab2-bd80-4855-8513-f56ea12f2748","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.829080Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:d3c7c02d64ad6acf3d91efbca388d0c307770d0a4f26f2e58d86f60c02b46f01","observation_id":"ed888521-334d-46be-b910-a37d407f457f","resolution":{"observed_at":"2026-08-07T11:41:12.710778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14735","last_updated":"2024-08-13T15:45:37Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:47:03Z","title":"How Transformers Learn Causal Structure with Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14735","snapshot_observed_at":"2026-08-07T11:40:57.895555Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.895555Z"},"links":{"cited_paper":"/paper/2402.14735","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:753aaecd18c6decbb682b23e064abeec9f156eb0dccb7404a6593f2eeda1920f","observation_id":"ff75ee10-68d8-4aa0-8153-f544be1c01b3","resolution":{"observed_at":"2026-08-07T11:40:57.895555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.350480Z","title":null,"venue":null,"work_id":"a7fbb3ad-4284-484e-a91c-9597882b7b84","year":1989},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.908032Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:b7d1a31eab52a8416fc5c501a54ea9e2893293d13b7376af9e6d82a89206c956","observation_id":"326c245e-c853-4bdb-b297-3cf83230767f","resolution":{"observed_at":"2026-08-07T11:41:12.451322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05787","last_updated":"2024-06-05T13:44:00Z","snapshot_observed_at":"2026-07-06T17:27:33.275341Z","submitted_at":"2024-02-08T16:24:44Z","title":"How do Transformers perform In-Context Autoregressive Learning?","version":2},"cited_work":{"arxiv_id":"2402.05787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05787","snapshot_observed_at":"2026-08-07T11:40:59.458963Z","title":"How do Transformers perform In-Context Autoregressive Learning?","venue":"stat.ML","work_id":"cb37fde8-6523-4456-a875-778564552fdc","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:57.962510Z"},"links":{"cited_paper":"/paper/2402.05787","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:1c87e88e58ad45b7fc46bddd518f30f7d24adb34c679dc807c2203f7b843969e","observation_id":"1bbec8c5-d780-4efd-b101-c71eff7e0608","resolution":{"observed_at":"2026-08-07T11:40:59.562424Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.961426Z","title":null,"venue":null,"work_id":"53f35480-9f0d-4a25-a222-cc5b30d4c085","year":2010},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.052249Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:f110b801cd23111832fa8a0ab1d1e43b3f18c1c252ad133989cd0a975137b4c2","observation_id":"bbe4fb67-cc2c-4df4-8f49-8e65cf0b7eb6","resolution":{"observed_at":"2026-08-07T11:41:12.243872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.510485Z","title":null,"venue":null,"work_id":"d8014561-6d98-4c60-963a-09fc76e0e6dc","year":2005},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.072860Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:b74ac01440884adca5931bb3e122a154482692de6afd9da3a2f16a4beab17db7","observation_id":"d925f7b2-3ae8-4090-8b14-6240d68b8245","resolution":{"observed_at":"2026-08-07T11:41:11.710017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.079206Z","title":"M., Gordon, G","venue":null,"work_id":"45fd3312-b1c6-487d-8cc3-8f892e019500","year":2010},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.089009Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:783e356fdd0a9f4166c0f91dd2b7ec9d05233c3aa600686be7da53aca0a64125","observation_id":"779e0284-b2c4-450c-8704-da4d773c4b42","resolution":{"observed_at":"2026-08-07T11:41:11.279696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.671307Z","title":null,"venue":null,"work_id":"b10e71a6-439c-4330-a354-121ace605a20","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.094976Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:2d9fa40c10f4c2a5719c0304061f5d4464faf1313b36fa288fe42d9e14f221ce","observation_id":"cf229b8a-0ba3-499e-80ec-c0e29e1ddead","resolution":{"observed_at":"2026-08-07T11:41:10.860102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:40:58.150549Z","title":"M., Hauth, A., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.150549Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:0cafb010a4a9db220dee9b2d55060ab5b2687173e22f31eb666ef7337317a256","observation_id":"3cdea488-9094-47f5-a437-92a721f7c29b","resolution":{"observed_at":"2026-08-07T11:40:58.150549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.343855Z","title":null,"venue":null,"work_id":"0e17d062-ff5c-40b9-8c76-b0591f45c755","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.217100Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:e2bba04cb7e5582b4c14c20e6668e2dd621a5f9d1a2b5128590b386a416f0e85","observation_id":"d1d4c934-f4a0-4538-9fc2-4ddb244e4398","resolution":{"observed_at":"2026-08-07T11:41:10.501658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.119824Z","title":"D., Kallus, N., and Sun, W","venue":null,"work_id":"95fd7e02-6b22-4be5-b21f-f1b7d621b84c","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.288808Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:e131efe39c0a881014e0f845d1a00c419146d0595f300a995ae03a7cd4d77413","observation_id":"f2c721da-71f6-4cf5-b227-b7e4ecb95e08","resolution":{"observed_at":"2026-08-07T11:41:10.221761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04652","last_updated":"2022-01-06T04:33:56Z","snapshot_observed_at":"2026-08-06T00:22:15.703926Z","submitted_at":"2021-10-09T22:04:34Z","title":"Representation Learning for Online and Offline RL in Low-rank MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04652","snapshot_observed_at":"2026-08-07T11:40:58.356295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.356295Z"},"links":{"cited_paper":"/paper/2110.04652","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:4d932fb81644d1359cfbade2f4eb007c07b6656bfd42f4a3a79a9dfc8581288e","observation_id":"8ec3ccfb-8c15-4498-bf95-836c4064540a","resolution":{"observed_at":"2026-08-07T11:40:58.356295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.882336Z","title":"and De Moor, B","venue":null,"work_id":"23281ee9-6113-4e7b-ac48-7dae7e78ea81","year":1995},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.439615Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:925d1f78931376647d5609b2e22a84667c3fc8aa53a60fdbf875e1b2422032e7","observation_id":"d11c2078-b3e0-4003-85bc-00a0f8735915","resolution":{"observed_at":"2026-08-07T11:41:10.002634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.679864Z","title":null,"venue":null,"work_id":"020ce9ae-e10c-43e0-86a1-2bad7ebe361a","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.508919Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:7e4142256650644bdb42016dd4aefe258d36e62a6d9413b180e6e3d3f4e4ced5","observation_id":"b144fd76-23a1-4a73-8fea-c564226b56d4","resolution":{"observed_at":"2026-08-07T11:41:09.757295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13476","last_updated":"2024-04-01T01:53:31Z","snapshot_observed_at":"2026-07-06T13:14:21.836046Z","submitted_at":"2022-05-26T16:34:46Z","title":"Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency","version":2},"cited_work":{"arxiv_id":"2205.13476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.13476","snapshot_observed_at":"2026-08-07T11:40:59.329804Z","title":"Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency","venue":"cs.LG","work_id":"f279114c-9e2c-4d4c-a3f8-0b1ced627d21","year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.622315Z"},"links":{"cited_paper":"/paper/2205.13476","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:21d5d5538c46f8bfd6575a9c8fd75b0076fead9fc32162ef1a2b72ff0ca6a8a6","observation_id":"7e694279-6e89-4837-8944-32f5895c4042","resolution":{"observed_at":"2026-08-07T11:40:59.387616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11916","last_updated":"2024-02-12T23:09:40Z","snapshot_observed_at":"2026-08-05T08:41:15.194836Z","submitted_at":"2023-01-27T18:59:01Z","title":"Large Language Models Are Latent Variable Models: Explaining and Finding Good Demonstrations for In-Context Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11916","snapshot_observed_at":"2026-08-07T11:40:58.649659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.649659Z"},"links":{"cited_paper":"/paper/2301.11916","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:3c37cd47cc8f3926c1a755fcca374085deff785e26f54753363be772f70b0da3","observation_id":"31ef48d3-c761-481b-8322-7b40f84d5bf2","resolution":{"observed_at":"2026-08-07T11:40:58.649659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T11:40:58.654553Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.654553Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:2d55c5d46a90a2cde98107f1b168dcc787a33e95c8a86b4c4d49aaa83a8526d2","observation_id":"61bfc8df-6e29-498f-a4bb-b80796adfafa","resolution":{"observed_at":"2026-08-07T11:40:58.654553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03383","last_updated":"2025-02-05T17:18:55Z","snapshot_observed_at":"2026-08-05T04:07:11.850183Z","submitted_at":"2025-02-05T17:18:55Z","title":"Transformers and Their Roles as Time Series Foundation Models","version":1},"cited_work":{"arxiv_id":"2502.03383","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03383","snapshot_observed_at":"2026-08-07T11:40:59.236173Z","title":"Transformers and Their Roles as Time Series Foundation Models","venue":"cs.LG","work_id":"73a733b3-6b61-41f1-b04c-e63e494086e6","year":2025},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.659411Z"},"links":{"cited_paper":"/paper/2502.03383","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:5e67f97371042206bd7f67174c288785e77cf4da8b11e0dded9d8c5ad436ad1e","observation_id":"731d3c29-9af1-406b-9439-20e3501f0d56","resolution":{"observed_at":"2026-08-07T11:40:59.244921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-07-30T03:45:35.558793Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-07T11:40:58.725453Z","title":"M., Raghunathan, A., Liang, P., and Ma, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.725453Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:9d14a3d8b6e14079e5fcc5ae6985864e212fe9cb0703142959e7c74ea89b10b7","observation_id":"9d9de378-adb2-4292-99b9-f01158159a3d","resolution":{"observed_at":"2026-08-07T11:40:58.725453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.405496Z","title":null,"venue":null,"work_id":"080f51bf-5852-42ed-8f0b-b85fcc146377","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.810045Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:c934e602a19e193fa2ad40dac557beef9da44e77f38bf67f418438a09da7b2fc","observation_id":"7ddbca05-3e2f-4a35-a360-4dbf9c978d31","resolution":{"observed_at":"2026-08-07T11:41:09.531435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.163034Z","title":null,"venue":null,"work_id":"d9947c3c-b95a-4bfc-9a8b-d4ac9fe7a9cf","year":2024},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.900185Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:7282c94d6d7efc67d362372d2dec1e927a4dc328ec45e9f1f36d413bcba87dd7","observation_id":"2da23092-c1ae-4d83-8bc9-f31ae897ad70","resolution":{"observed_at":"2026-08-07T11:41:09.288353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05738","last_updated":"2022-08-13T15:21:02Z","snapshot_observed_at":"2026-07-06T13:30:32.141738Z","submitted_at":"2022-07-12T17:57:17Z","title":"PAC Reinforcement Learning for Predictive State Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05738","snapshot_observed_at":"2026-08-07T11:40:58.992054Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:58.992054Z"},"links":{"cited_paper":"/paper/2207.05738","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:d4b6c28109e082f9985f55c8f110237c2e520a54a0c7dbbac6ef0988353bfb32","observation_id":"a4394478-de6c-47ae-8fce-b8b756c13a87","resolution":{"observed_at":"2026-08-07T11:40:58.992054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:00.009097Z","title":null,"venue":null,"work_id":"a3089ee2-fd36-47a6-965a-7bd2d2dab269","year":2023},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:59.082190Z"},"links":{"citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:fc0ead7af72689efdc75483c1d0d410453ca3a12ea2b43111448ad21f589ae9f","observation_id":"921f6718-d955-4964-b11a-baad02b271c8","resolution":{"observed_at":"2026-08-07T11:41:08.735863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01962","last_updated":"2023-06-30T13:05:42Z","snapshot_observed_at":"2026-07-06T14:14:06.039306Z","submitted_at":"2022-11-03T16:42:40Z","title":"GEC: A Unified Framework for Interactive Decision Making in MDP, POMDP, and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01962","snapshot_observed_at":"2026-08-07T11:40:59.125143Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:40:59.125143Z"},"links":{"cited_paper":"/paper/2211.01962","citing_paper":"/paper/2506.01919"},"observation_digest":"sha256:9cba4f5e5092967e0603fc0cca95762a745bfb2dfb7748500cda21c7a1211fa0","observation_id":"cd2b7cde-9753-4264-84e6-239d9620c0e8","resolution":{"observed_at":"2026-08-07T11:40:59.125143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01919","last_updated":"2025-06-02T17:39:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:29:07.518148Z","submitted_at":"2025-06-02T17:39:31Z","title":"Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":40,"verified_exact":4,"verified_fuzzy":5},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.01919."}