{"as_of":"2026-08-08T04:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64de648483fdf44f24df4b48e1161f1997dc6e926ae0fbd2fff149c4186e630b","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:52:37.467712Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11108/citation-record","integrity":"/paper/2506.11108/integrity","json":"/paper/2506.11108/citation-record.json","paper":"/paper/2506.11108"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:52:37.384927Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.384927Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:d724871e9715005815696eec5713644c4a474bc85962c4d0320ccf74a5251229","observation_id":"72d0b169-3be9-4ad3-b19a-a649f5e48bb2","resolution":{"observed_at":"2026-08-07T05:52:37.384927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.737144Z","title":"Language models are few-shot learners","venue":null,"work_id":"6db8212b-f784-45d9-b046-2c051378e38e","year":2020},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.390175Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:8af1a2c553861a8a3489c8e6ccd25cfa2f9176fd0f57bec44e11393adf43b864","observation_id":"95fc398d-a297-4f1c-8d98-b458fc6fc4de","resolution":{"observed_at":"2026-08-07T05:52:37.740477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.727424Z","title":null,"venue":null,"work_id":"34248f1e-1fd7-44ab-a28f-7502b1e338ed","year":2019},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.394048Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:f94fdf18816c5a1ca5a1976e60e40a43ade2763eb6318338f8c499d65e03905e","observation_id":"83ae9183-4e70-4620-b61b-65f555a32da2","resolution":{"observed_at":"2026-08-07T05:52:37.730864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:52:37.397713Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.397713Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:c4f572be8b5613f239b087fabeefe838501d2ddaf16ebc5cef3378acd7ec26fe","observation_id":"f9e3cc82-2c77-42fe-9f70-a59af461c138","resolution":{"observed_at":"2026-08-07T05:52:37.397713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.717732Z","title":null,"venue":null,"work_id":"529743f8-e5c2-43f3-978b-ae20960ca36d","year":2019},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.401755Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:2389b6d2262d2cf40f0653d5b1f42a803089ab57f600e470d4c0ec333fe7043c","observation_id":"c5296904-1e35-4486-90f4-70d32b9ce972","resolution":{"observed_at":"2026-08-07T05:52:37.721317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:52:37.405709Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.405709Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:eaf4558eb08a2a498dde0de347562af64c441e822df11f45c705400d1eba7f8c","observation_id":"e61d4da4-d49a-4d25-b718-a9518800205f","resolution":{"observed_at":"2026-08-07T05:52:37.405709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.707893Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"bd09c67c-fd7d-49a9-986c-8e6ff55550bb","year":2017},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.409857Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:93f4eb7e5fa44dfabcf0d4bd7a96240d05ce6be13749394ed06140e2e12ea6e5","observation_id":"ddc4387c-1470-43ea-9c0d-159fe149b04a","resolution":{"observed_at":"2026-08-07T05:52:37.711382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:52:37.413252Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, et al","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.413252Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:2f3fe8fc6fdffe85fed612924676b37a1ef584702c248beede2e4ed55e405990","observation_id":"0e4178c0-d51f-44b3-9909-0b9cf4367ed0","resolution":{"observed_at":"2026-08-07T05:52:37.413252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02700","last_updated":"2022-06-06T15:57:28Z","snapshot_observed_at":"2026-07-06T13:17:55.016298Z","submitted_at":"2022-06-06T15:57:28Z","title":"Forbidding Edges between Points in the Plane to Disconnect the Triangulation Flip Graph","version":1},"cited_work":{"arxiv_id":"2206.02700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.02700","snapshot_observed_at":"2026-08-07T05:52:37.533698Z","title":"Forbidding Edges between Points in the Plane to Disconnect the Triangulation Flip Graph","venue":"cs.CG","work_id":"d1592dab-7371-4d62-adbc-2fc87aadc56f","year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.417126Z"},"links":{"cited_paper":"/paper/2206.02700","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:565338aa5f66c8d1f560de32d83ccf2fbe5a6dcd8c8ba7146fe2e0a722a9ba93","observation_id":"69c3fb62-ea1b-4370-9c14-13645bb1e41c","resolution":{"observed_at":"2026-08-07T05:52:37.537609Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10482","snapshot_observed_at":"2026-08-07T05:52:37.420740Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.420740Z"},"links":{"cited_paper":"/paper/2502.10482","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:cd9b4136e6242b6ab424892f0809fb4682a1ac7e23c98254e091acf1499599e9","observation_id":"4ea29d57-e741-4927-bbac-f4f04f0a78e3","resolution":{"observed_at":"2026-08-07T05:52:37.420740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01212","last_updated":"2023-06-30T15:19:33Z","snapshot_observed_at":"2026-07-06T15:49:51.367067Z","submitted_at":"2023-06-30T15:19:33Z","title":"Of Spiky SVDs and Music Recommendation","version":1},"cited_work":{"arxiv_id":"2307.01212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.01212","snapshot_observed_at":"2026-08-07T05:52:37.507115Z","title":"Of Spiky SVDs and Music Recommendation","venue":"cs.IR","work_id":"731a434a-73fe-43cf-ad83-5dcd79a1203f","year":2023},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.424314Z"},"links":{"cited_paper":"/paper/2307.01212","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:714307bd49fd3d73c9d11ed966393b63cbc7fb07de8c2fcb30e85b9e6ae823ed","observation_id":"846290f6-a6b0-4630-b414-6dc7278644c8","resolution":{"observed_at":"2026-08-07T05:52:37.512806Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.698365Z","title":"MultiWOZ—a Large-Scale Multi-Domain Wizard-of-Oz Dataset for Task-Oriented Dialogue Modelling","venue":null,"work_id":"83bc6f06-b777-4f8a-a3b7-b1238905228a","year":2018},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.427985Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:6c70ea31f7a12acd4019baf70014b7c1e24881a26302f24e94d246a71f4a19fc","observation_id":"c2cb8527-6812-487d-9d03-8a76b2428d1d","resolution":{"observed_at":"2026-08-07T05:52:37.701855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.688550Z","title":"Revisiting Self-Training for Neural Sequence Production","venue":null,"work_id":"ac93ee7e-c651-4d5d-8050-02710822ba4c","year":2021},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.431013Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:d5e5d277202fbcf3ae5cbd8244154e9c1d28a3697e27513d287ae8a285a3a89a","observation_id":"4d91aee7-e62e-4922-b537-758cb1c5dc4e","resolution":{"observed_at":"2026-08-07T05:52:37.692145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10368","last_updated":"2021-08-02T07:05:28Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:47:21Z","title":"MSMatch: Semi-Supervised Multispectral Scene Classification with Few Labels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10368","snapshot_observed_at":"2026-08-07T05:52:37.434235Z","title":"Chain-of-Thought Prompting Helps Language Models Reason","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.434235Z"},"links":{"cited_paper":"/paper/2103.10368","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:96b12c3c8cb5ad37831614280d3c15b48e574a25c819477b48f48c835b684248","observation_id":"0a603438-15e4-4886-953d-5163a5e466af","resolution":{"observed_at":"2026-08-07T05:52:37.434235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.678956Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":null,"work_id":"a32fc15a-8048-4153-af42-922d78295ede","year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.437664Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:eb3f3df8cdc58d633aa345a4a71e0ce9bfa192c1be7320ef01123cf0390850dc","observation_id":"764905fd-a53d-4052-8763-0ddd164b93f6","resolution":{"observed_at":"2026-08-07T05:52:37.682326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.669007Z","title":"Self-Coherence Score: Learning to Verify Reasoning Paths in Large Language Models","venue":null,"work_id":"9aba4ed9-d16a-4665-9b9f-a73423461e34","year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.440801Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:c05ad3311ae6751edabf3ac0b1b669db78e647cac096ce9ea5169cc7629ec151","observation_id":"022d703c-b974-4e7b-93cf-0b867d6ea5ec","resolution":{"observed_at":"2026-08-07T05:52:37.672657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.658347Z","title":"Towards Learning to Explain: An Attention-Based Self-supervised Approach for Improving Multi-turn Dialogue Mod- els","venue":null,"work_id":"7ad9780a-985f-47fb-a7b6-3c5be9c06832","year":2020},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.443830Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:ce0e3627cdf89dce58585d1617f8b6fe703077b80aae7b62f3bca5af28b8e7ab","observation_id":"8b29ce70-553b-44d5-95c6-95b31b4709a1","resolution":{"observed_at":"2026-08-07T05:52:37.662076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.647584Z","title":"Deep Reinforcement Learning for Dialogue Generation","venue":null,"work_id":"e2ef6064-60ec-46b0-8bc4-6fdf566c94ef","year":2017},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.447125Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:5ab29cae1cc0fbf303d99b789319c2a559b41955b20cdeb9e2f3f6af060d8483","observation_id":"eede9a13-b25e-4d6c-a7af-2b0f3b5ededd","resolution":{"observed_at":"2026-08-07T05:52:37.651273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.636637Z","title":"Serban, Michael Noseworthy, Laurent Charlin, Joelle Pineau","venue":null,"work_id":"34aef9ee-8244-474b-923c-56db273192c3","year":2019},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.450503Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:f613ccf1834ea19994df502596c52d9f14dd4e8f9ee33f3df287c74263dd05be","observation_id":"c4a4364f-c68c-4ec6-8331-d7f828067bec","resolution":{"observed_at":"2026-08-07T05:52:37.640452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.625269Z","title":"Global Contextual Reinforcement Learning for Multi-Turn Dialogue","venue":null,"work_id":"43706dfe-d911-4896-8b65-269decfae664","year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.453810Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:d55bdd362f7168e4a6a1d877c8961d432228c8309c4dda5493a290d8a2445497","observation_id":"d2a4a14f-8c88-460f-974c-d130dd9f710b","resolution":{"observed_at":"2026-08-07T05:52:37.629095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.615190Z","title":null,"venue":null,"work_id":"58371ae5-7d7e-4e50-9e10-f3efb35e6a43","year":2022},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.457214Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:1fd47b9a691efa696cabc8a841314839746dfc3a9ad98b01e2242660bc2bc220","observation_id":"9e99d459-4187-4367-a9ff-e644468930e8","resolution":{"observed_at":"2026-08-07T05:52:37.618657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.604731Z","title":"Self-Supervised Learning for Cross-Attention in Neural Text Generation","venue":null,"work_id":"b99c195d-33ae-4945-a8c2-048e31ce0218","year":2020},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.460714Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:639c1a0d361cc9cc7b04334c2da586de52aa3b8e058205ea746bc6095f4e21b1","observation_id":"f4ebcfa9-5b09-4cb7-a35d-de0961c06ae5","resolution":{"observed_at":"2026-08-07T05:52:37.608483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.594441Z","title":null,"venue":null,"work_id":"94d2606a-e286-4340-b456-0676748f87c3","year":2020},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.464309Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:2e01a6eee8510fd3e648214c9d6707535e1b562501f8a6ab284c5078bfa83088","observation_id":"eb3fbd76-b702-40c7-a15d-10a9e7fe4afc","resolution":{"observed_at":"2026-08-07T05:52:37.597791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:37.583923Z","title":"Ziegler, Ryan Lowe, Ilya Sutskever, and Paul F","venue":null,"work_id":"552f84c3-2aa7-4389-8304-231251612b9e","year":2020},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.467712Z"},"links":{"citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:f080766b420e071198856e6297f4096f441c3496c803435ecbcdabca67dd39a0","observation_id":"a8349cd4-dc5c-4e84-8523-89a1cee13161","resolution":{"observed_at":"2026-08-07T05:52:37.587437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2506.11108."}