{"as_of":"2026-08-08T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfe7730cbb94db4fa6cbe50db6f78a413d5f374f965c3f4567bb7b2c7ce53124","coverage":[{"denominator":277,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:44:44.107619Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20917/citation-record","integrity":"/paper/2506.20917/integrity","json":"/paper/2506.20917/citation-record.json","paper":"/paper/2506.20917"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T22:44:42.951443Z","title":"Nemotron-4 340b technical report.arXiv preprint arXiv:2406.11704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:42.951443Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e018115dba39596cae06c7b979e02329350a7556f3cd35e01c3f5e319b448e9b","observation_id":"4b73827d-5f4f-4f31-819b-a794dfb137a7","resolution":{"observed_at":"2026-08-06T22:44:42.951443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:42.966717Z","title":"Publicly available clinical BERT embeddings","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:42.966717Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b764b34bcaf5aeda5f028dbfc66748f048c892d6ffcdf8b9ba8e8a4806ee15e7","observation_id":"8d58da42-ab95-45b2-a929-d5c97fcc36c8","resolution":{"observed_at":"2026-08-06T22:44:42.966717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:42.977418Z","title":"Reid, Stephen Gould, and Anton van den Hengel","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:42.977418Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:38a2c3a1e94e3418ab1b34b1fa7e6342ab0f6ec0ffd5b0a032a68de4c5bd807e","observation_id":"d875b45e-72aa-4a79-97fe-5717c8862855","resolution":{"observed_at":"2026-08-06T22:44:42.977418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02983","last_updated":"2020-06-29T08:18:31Z","snapshot_observed_at":"2026-08-08T01:12:48.325565Z","submitted_at":"2019-08-08T09:17:54Z","title":"Pseudo-Labeling and Confirmation Bias in Deep Semi-Supervised Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02983","snapshot_observed_at":"2026-08-06T22:44:43.098284Z","title":"Pseudo-labeling and confirmation bias in deep semi-supervised learning","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.098284Z"},"links":{"cited_paper":"/paper/1908.02983","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:36d910cc262e452ee5f8fe074277ffda94c35b6c53ea9daa999f5011bced0c4a","observation_id":"de2b65ba-e9fa-490f-b0aa-9524bb270450","resolution":{"observed_at":"2026-08-06T22:44:43.098284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.199897Z","title":"Tran, Dara Bahri, Jianmo Ni, Jai Prakash Gupta, Kai Hui, Sebastian Ruder, and Donald Metzler","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.199897Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:34324c63e83c13905ce283b19e1c713d37a6e3fa86ac4502b13383e0bf4a3597","observation_id":"13c2475a-6020-4db0-bf03-fbd2d68919fc","resolution":{"observed_at":"2026-08-06T22:44:43.199897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.209437Z","title":"A robust self-learning method for fully unsupervised cross-lingual mappings of word embeddings","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.209437Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:646cc96fc51e72bd0a5bdf795f25d028bf0089951ac68f87c0f04802a65214cd","observation_id":"b706fb71-2eaa-44fe-b1ee-ab20c66b1dcf","resolution":{"observed_at":"2026-08-06T22:44:43.209437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.213678Z","title":"ATTEMPT: Parameter-efficient multi-task tuning via attentional mixtures of soft prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.213678Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:56b937ff08fa6860f95151d36b374b53e96c60fd9ccd120d119ccece172edf08","observation_id":"7c41c763-bf8e-4833-8255-181336720d8c","resolution":{"observed_at":"2026-08-06T22:44:43.213678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T22:44:43.218178Z","title":"Program synthesis with large language models.ArXiv preprint, abs/2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.218178Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1f381f2738b9b58aad2266191f0be27153b60128a4b7787f78a36ec27d7e63a8","observation_id":"cb805e14-e2aa-457e-93b7-6ac967060ede","resolution":{"observed_at":"2026-08-06T22:44:43.218178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.232106Z","title":"A general theoret- ical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.232106Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:572787f49f25b10686541bc2caa6f05bb7a31ea6a4a8868f4e7465d39671e49a","observation_id":"326ed919-0310-4d12-96cc-abb66d392730","resolution":{"observed_at":"2026-08-06T22:44:43.232106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T22:44:43.277409Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.277409Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3e3c9e75ed331834908606e59adbf13f365fa7aea3ca3ec6a56159266596ffe5","observation_id":"c588d5d2-b57b-4974-9429-dfde47e4da1b","resolution":{"observed_at":"2026-08-06T22:44:43.277409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T22:44:43.346100Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.ArXiv preprint, abs/2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.346100Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8985548a1d7ab8c34ee641b0969d42796a9d8273020489027e3961f31b90e949","observation_id":"73ab6ab2-a9fc-4a1f-9b19-3e278d9fb56f","resolution":{"observed_at":"2026-08-06T22:44:43.346100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.421930Z","title":"Brain power.Proceedings of the National Academy of Sciences, 118(32):e2107022118, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.421930Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ebe7dcea3f8c9661a2d0e073511818e29ee30ebc42ce1a8ea822f3f87e254e6e","observation_id":"1d63966b-582c-458a-a353-c8ce30255fa7","resolution":{"observed_at":"2026-08-06T22:44:43.421930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.483528Z","title":"SciBERT: A pretrained language model for scientific text","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.483528Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1c66560caf2db435cb35466b9ba3684e8082219a4521930d56d22b3d1f13851f","observation_id":"c1dcd433-9c1f-4cc8-9b5a-81a82ff68d29","resolution":{"observed_at":"2026-08-06T22:44:43.483528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.535208Z","title":"BitFit: Sim- ple parameter-efficient fine-tuning for transformer-based masked language- models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.535208Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:a96c3720207b2bf09453d9f3109c617896e54d74db4d639d72ebc42257c59a55","observation_id":"45cd9730-f44b-49f8-b7a3-f76a57fa7777","resolution":{"observed_at":"2026-08-06T22:44:43.535208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.597280Z","title":"Bender, Timnit Gebru, Angelina McMillan-Major, and Shmargaret Shmitchell","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.597280Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:6ca0d42c3f986fe2a7f278b7845737c27cd16158c8fab51fbc293bc47162e8f9","observation_id":"f4135c37-405d-45af-8bad-6890dd4292b4","resolution":{"observed_at":"2026-08-06T22:44:43.597280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.732143Z","title":"Bender and Alexander Koller","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.732143Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:55a8b162a4f110d49d1991a1f30a39ea6a1640e81fca65c37d66a0e2bb27402c","observation_id":"fe5548a5-b899-4d00-bc42-83efd4540425","resolution":{"observed_at":"2026-08-06T22:44:43.732143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.735683Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.735683Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:661cacd14b965c925538347198c69337a8a06ffb834d4774b3f234ed7a90dc24","observation_id":"e892c41f-67e4-4c8e-b2f6-0e9409c15c00","resolution":{"observed_at":"2026-08-06T22:44:43.735683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.738874Z","title":"The fifth PASCAL recognizing textual entailment challenge","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.738874Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:f00122c7a674f502aae107b5d68fa62b82406513b1c156aebf12c541f0ea1755","observation_id":"8ba42f1b-4a05-44d1-a5f5-188fe7c5356d","resolution":{"observed_at":"2026-08-06T22:44:43.738874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.742786Z","title":"Cubuk, Alex Kurakin, Kihyuk Sohn, Han Zhang, and Colin Raffel","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.742786Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:37c56808503f8cc90eabd33cf49bcf124ed40414f3ad25cdbf20bb16ca89ca1a","observation_id":"a0832af2-56e1-47af-8bba-2b9b04704280","resolution":{"observed_at":"2026-08-06T22:44:43.742786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.746891Z","title":"Goodfellow, Nicolas Papernot, Avital Oliver, and Colin Raffel","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.746891Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:85cac2113d777ef6ab1ab1c8d70976f9713bbb841e06574b4466b10fbd1fce3f","observation_id":"3c194945-8026-4ce1-ab53-234328ee7e19","resolution":{"observed_at":"2026-08-06T22:44:43.746891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.750663Z","title":"Adamatch: A unified approach to semi-supervised learning and domain adaptation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.750663Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d03983ac2e9eec43bc389c2f7ff38dc7e049335f628e23eaeacee2fe4ad3dc90","observation_id":"49f58851-1f47-4f28-8cd0-f06bb0480165","resolution":{"observed_at":"2026-08-06T22:44:43.750663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.754753Z","title":"Shih, Yejin Choi, and Daniel Marcu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.754753Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:cf531027b7ca0e27a094429ea2e00755932ead78ebd95e4d93d30e568d2d96e0","observation_id":"647b04ba-67f9-4605-8227-34babddd1e3c","resolution":{"observed_at":"2026-08-06T22:44:43.754753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.759066Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.759066Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3391eab05cf87eaa8b3cebd1498127094776e526a6fef51a4c950fe1879fabc2","observation_id":"7695e2b0-2af6-4ec2-a284-36335d8dfe45","resolution":{"observed_at":"2026-08-06T22:44:43.759066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.763474Z","title":"Bowman, Gabor Angeli, Christopher Potts, and Christopher D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.763474Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c3da824b1c7fa521628b464ad960d2aacd19aa7bbcbaba6db5a3c18575876932","observation_id":"1afe4fb7-f00c-4da2-bf75-566cd5d388d2","resolution":{"observed_at":"2026-08-06T22:44:43.763474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.768026Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.768026Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e126810f04f5cd0a44a50053ca9f3a9dd2dec9de319b847f509b518614140df4","observation_id":"88dc5620-7baf-42b8-ba46-bec13b826d0b","resolution":{"observed_at":"2026-08-06T22:44:43.768026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.772139Z","title":"Semi-supervised semantic role labeling with cross-view training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.772139Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:850f887e6c8afb216d1124f3e72b127d2e510a860bbab2474f18e92620ec3b22","observation_id":"0ba7bc8b-8f5b-4ba0-aee8-fd2cf466cfaf","resolution":{"observed_at":"2026-08-06T22:44:43.772139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.777079Z","title":"Findings of the 2009 Workshop on Statistical Machine Translation","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.777079Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:403bd748c609d6da82147b5856302dd4c2e37d38317da6bf110694449cb37e0b","observation_id":"e9b5ec18-87be-4a50-aaf6-7afa6c962e28","resolution":{"observed_at":"2026-08-06T22:44:43.777079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.781782Z","title":"Extracting training data from large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.781782Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1b612a4787df5582f41ab0be4c87c606ed5f6ae91496510ad7eb58a0f31304ff","observation_id":"64557a6d-0750-4240-86e8-c773f78a6539","resolution":{"observed_at":"2026-08-06T22:44:43.781782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.790303Z","title":"SemEval-2017 task 1: Semantic textual similarity multilingual and crosslingual focused evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.790303Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8f1707e5c441fbb6c571cf0dd60aeee9038e93c414b4e9504d36b92ee34bbe9a","observation_id":"1dd787d0-4e16-421b-b31d-acd77c5e2bf0","resolution":{"observed_at":"2026-08-06T22:44:43.790303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.794286Z","title":"Importance of semantic representation: dataless classification","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.794286Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:11af99e3582f40ad0077b051d612c5b712aedb7119683499970334d7e8e94398","observation_id":"f8595921-d963-4d70-9f72-775a66f409b4","resolution":{"observed_at":"2026-08-06T22:44:43.794286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.798701Z","title":"Semi-supervised BIBLIOGRAPHY 121 learning (chapelle, o","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.798701Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:53d194137edeafa2dcc2cdd247d85a111578438aad199866a47ddbc25a7a6620","observation_id":"afb4a726-e2b8-409d-8cf9-fafd94f1b3db","resolution":{"observed_at":"2026-08-06T22:44:43.798701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.802803Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.802803Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3e9d0afa1c9d49cc662e356446492c900e9f78eaf3ef8ed9b2449599288a8cae","observation_id":"a6fe9601-807c-43b7-8236-ab98669c0721","resolution":{"observed_at":"2026-08-06T22:44:43.802803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.806846Z","title":"Debiased self-training for semi-supervised learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.806846Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:0d89bcca4aa065518b34a9b51d917a72813d29491f53bbe235ef4f07ae2cf9c2","observation_id":"514b73ed-c09b-4d89-b55f-282201ca692b","resolution":{"observed_at":"2026-08-06T22:44:43.806846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.810858Z","title":"Unseen filler generalization in attention-based natural language reasoning models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.810858Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:941dffe6f080d807da7e700a8416e13774a84948cbc0ae6357cfbd608d807928","observation_id":"98443fdc-0446-422f-b965-4ec3a5b44748","resolution":{"observed_at":"2026-08-06T22:44:43.810858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.814900Z","title":"TOUCHDOWN: natural language navigation and spatial reasoning in visual street environments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.814900Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:4e6fc36f95dc8ab2f3d1b823c3153064e386cae51f0bb3aad5f6acd92e7313bd","observation_id":"386a0536-a5ec-470d-b323-6eda5ce5e618","resolution":{"observed_at":"2026-08-06T22:44:43.814900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.818998Z","title":"MixText: Linguistically-informed interpolation of hidden space for semi-supervised text classification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.818998Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bf9ab7eebc0b7a21d45e8383d054ae4e5aa1277c7f6175050f080ecc984674e6","observation_id":"b962e938-27ce-4e8f-aa7c-9faf82ffd4e7","resolution":{"observed_at":"2026-08-06T22:44:43.818998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.823064Z","title":"Alpagasus: Training a better alpaca model with fewer data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.823064Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5e62b9759c655b15e4b98a7be7743f5496c09c871bedbae51e510e3dca34022f","observation_id":"f9e4a0c8-d035-4a5e-88cc-d8cf8c5af729","resolution":{"observed_at":"2026-08-06T22:44:43.823064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T22:44:43.827536Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.827536Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:f869c828d4b4cca3d82e88d49f832713537d4be37f207381e7512b02ef0013b5","observation_id":"9c8fff1d-b1a5-4387-87e1-cd0d4ad17d28","resolution":{"observed_at":"2026-08-06T22:44:43.827536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T22:44:43.832810Z","title":"Microsoft coco captions: Data collection and evaluation server.ArXiv preprint, abs/1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.832810Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:216fa3840f4cef50cdfa29f9f023e1510e3eaf49a73b6a7a5030a57199eb01cf","observation_id":"7f06129c-3df5-41a6-b17c-859f4f8c4064","resolution":{"observed_at":"2026-08-06T22:44:43.832810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.837349Z","title":"Adapt- ing language models to compress contexts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.837349Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ab4c97fd45def981bcda7f278fcab1fe4f23bc035ef99edc8cb1740f68c3b585","observation_id":"4ceffca8-0791-4934-b47d-4c6d2435dd28","resolution":{"observed_at":"2026-08-06T22:44:43.837349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.845371Z","title":"Gonza- lez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.845371Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:7fe5bca3d8975e5182a86c856fd8fe0f0ede3e63cd72dcded93eb41b458aec1e","observation_id":"fa025a4d-3938-4dc7-ae30-02f10aee1c4f","resolution":{"observed_at":"2026-08-06T22:44:43.845371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T22:44:43.849926Z","title":"Palm: Scaling language modeling with path- ways.ArXiv preprint, abs/2204.02311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.849926Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:a0af983b992a19c4b8d7a02a2acdb0f1e3e87aab9d6be828df4e6c246527c352","observation_id":"9c40c8b1-87b4-48d4-af4d-f8c49374f510","resolution":{"observed_at":"2026-08-06T22:44:43.849926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.854454Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.854454Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:fdafb06e14a120f3ace4ca34e7866e333a061434a38072b36c925c1521f58e4c","observation_id":"45174e3b-1722-46a6-a373-2527451532a5","resolution":{"observed_at":"2026-08-06T22:44:43.854454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.858540Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.858540Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d6cb7b728b4bd86756f7563047eee7adbdb1eaffcabc8c01f3310cefd3927946","observation_id":"d17e3aa2-e9d1-4863-9736-8477ecfe52a5","resolution":{"observed_at":"2026-08-06T22:44:43.858540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.863023Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.863023Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ff646942b6d2d4d2a3fb93f045d92ef6a9d49aad2f181b6640cd786aa21bb9f8","observation_id":"8acdc684-4fc2-4f76-b0dc-e2f9b1611de0","resolution":{"observed_at":"2026-08-06T22:44:43.863023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.867863Z","title":"Manning, and Quoc Le","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.867863Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5a88b90b4357a73671b86c09f15848e3069f43304ecb30185011cac1c8b66b3e","observation_id":"6e83cee6-2d08-4b0f-ba24-1a8539d6dc57","resolution":{"observed_at":"2026-08-06T22:44:43.867863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T22:44:43.871934Z","title":"Think you have solved ques- 124 BIBLIOGRAPHY tion answering? try arc, the ai2 reasoning challenge.ArXiv preprint, abs/1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.871934Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b5f30c8a8c778175f1dae5f726066c04894cf48854809b91f695f930f8d96196","observation_id":"b4666c98-7120-4c9d-be79-d49331aab7b6","resolution":{"observed_at":"2026-08-06T22:44:43.871934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.876140Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.876140Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bd1f0d471e9b1cd971c4d4361caaec3ec574e4dfcace25b342af05d20abead0f","observation_id":"6cacfbce-4e24-404a-956c-d73ec416b0ad","resolution":{"observed_at":"2026-08-06T22:44:43.876140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.880797Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.880797Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:6c9b39f2bda50bdedb6eaf8cda6d983b9211f6e35391708d00bd5545df34095b","observation_id":"3dc26713-97e4-4cf2-bb77-6646961dcab3","resolution":{"observed_at":"2026-08-06T22:44:43.880797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.884647Z","title":"The PASCAL recog- nising textual entailment challenge","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.884647Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9b1c35e7656debb79437f453fc27e81978330f1ab67e62e0b862f11e7a948a54","observation_id":"4cd63697-8582-43e4-b949-2fed3f54d4b6","resolution":{"observed_at":"2026-08-06T22:44:43.884647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.888406Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.888406Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:e872e041bec3ea398db7b49bbceb011df7f3d3e5e76b693b23867170f090b461","observation_id":"03f88398-73a0-4d54-85f4-752cafe668ed","resolution":{"observed_at":"2026-08-06T22:44:43.888406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.892250Z","title":"The commitmentbank: Investigating projection in naturally occurring discourse","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.892250Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:085ea5281dcd710b5a2f24e9d4c247adfe0a055172ddce77a806c6e4e32093b2","observation_id":"51c23cfc-d3dd-4812-8719-9751fa392809","resolution":{"observed_at":"2026-08-06T22:44:43.892250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.896950Z","title":"Universal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.896950Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:62901d3f7c4417c053d9a2a89d216fb495b710fadca40398f4dd7d05a4ce5de7","observation_id":"8cd2fcdd-14b9-44cc-bb5c-ffb64dc62880","resolution":{"observed_at":"2026-08-06T22:44:43.896950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.905116Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.905116Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:28fd069cb187a04b682fa85714717677d3a1b435fd64eaba379556bd9cfb6d23","observation_id":"78874513-6b27-49cc-b158-b38ccc5f947a","resolution":{"observed_at":"2026-08-06T22:44:43.905116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08508","last_updated":"2021-10-26T15:55:56Z","snapshot_observed_at":"2026-07-06T10:24:44.620578Z","submitted_at":"2020-12-15T18:57:40Z","title":"Attention over learned object embeddings enables complex visual reasoning","version":3},"cited_work":{"arxiv_id":"2012.08508","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.08508","snapshot_observed_at":"2026-08-06T22:44:45.596337Z","title":"Attention over learned object embeddings enables complex visual reasoning","venue":"cs.CV","work_id":"f7aee2c0-01bc-4749-bd1b-2a83897f9e68","year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.909542Z"},"links":{"cited_paper":"/paper/2012.08508","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bf62c3f3144c700e0fb75f500fdae8c6313f945b856d2fb2185b8f666f0892a0","observation_id":"0f4a975a-d3e1-4246-83c7-65ffeddc1ea9","resolution":{"observed_at":"2026-08-06T22:44:45.601668Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.917917Z","title":"Dolan and Chris Brockett","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.917917Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:eb9d378621ac6c2e1a42f42bca3beef977252bfc1091d29008780c7be1992e0e","observation_id":"485d0deb-e583-40a7-b3aa-d221baf29a60","resolution":{"observed_at":"2026-08-06T22:44:43.917917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.921533Z","title":"A robust self-learning framework for cross- lingual text classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.921533Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:143ba6dc1228ede260a0d855db89aee9c7ef7ea0eaa98ca08878e7fa90cd36d8","observation_id":"c54d89f2-42da-4a6f-bc85-75bd718958c9","resolution":{"observed_at":"2026-08-06T22:44:43.921533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:44:43.925514Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.925514Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8ba5b3cfda9aaa4106d74afa698dec35ae939aa715523e64a3133111a4f783e5","observation_id":"b1cf96da-04a9-4bfd-82c9-07bc2ef89990","resolution":{"observed_at":"2026-08-06T22:44:43.925514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05179","last_updated":"2017-06-11T11:51:06Z","snapshot_observed_at":"2026-08-01T17:16:13.609906Z","submitted_at":"2017-04-18T02:42:17Z","title":"SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05179","snapshot_observed_at":"2026-08-06T22:44:43.929753Z","title":"Searchqa: A new q&a dataset augmented with context from a search engine.ArXiv preprint, abs/1704.05179, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.929753Z"},"links":{"cited_paper":"/paper/1704.05179","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:0f8fd84aee3e41aa0d53ce8fe364d8c445c2aee04404b0e59e2ff4f387c35286","observation_id":"454af4f4-62f4-4af8-bcea-b3ab0bf330a0","resolution":{"observed_at":"2026-08-06T22:44:43.929753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.934143Z","title":"MRQA 2019 shared task: Evaluating generalization in reading com- prehension","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.934143Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:ec83306653e7cadd99fa21a6853d75fedc64f07aa0423b5843e8d5497e761b0d","observation_id":"ca3c2e8d-9098-4958-a20d-fb04887dc98f","resolution":{"observed_at":"2026-08-06T22:44:43.934143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.938432Z","title":"Making pre-trained language models better few-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.938432Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:37c4b4df25c04fcd99787f542a469580946cc9c4ad1746b6fe4823c8c7d0f661","observation_id":"51d56377-32f5-4d7f-9ec8-b748e575d177","resolution":{"observed_at":"2026-08-06T22:44:43.938432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.943172Z","title":"Zero-shot text classification with self-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.943172Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:7da92647a80d750142d9e9e57682fe49323ec6add401c285a0e0057aabf6ce61","observation_id":"fd02e4cf-c60f-4c36-9207-7682117dccb2","resolution":{"observed_at":"2026-08-06T22:44:43.943172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.951585Z","title":"The third PASCAL recognizing textual entailment challenge","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.951585Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c67de60a8be9bd90dd7e9f391c6b9973b62a6336b7c13f88420f1652f405b093","observation_id":"f6a792ca-a239-401e-8b3e-020e0c206176","resolution":{"observed_at":"2026-08-06T22:44:43.951585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10836","last_updated":"2022-01-26T09:31:55Z","snapshot_observed_at":"2026-08-05T22:08:58.465174Z","submitted_at":"2022-01-26T09:31:55Z","title":"PARS: Pseudo-Label Aware Robust Sample Selection for Learning with Noisy Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10836","snapshot_observed_at":"2026-08-06T22:44:43.955463Z","title":"Pars: Pseudo-label aware robust sample selection for learning with noisy labels.ArXiv preprint, abs/2201.10836, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.955463Z"},"links":{"cited_paper":"/paper/2201.10836","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:c937ce2fa9c532087e973553fdb6ef7be21c61c0bf03dffa14f9419524566f8e","observation_id":"dc6b9d1b-277a-4708-9c8f-73a7cb4f0847","resolution":{"observed_at":"2026-08-06T22:44:43.955463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.960188Z","title":"Making the V in VQA matter: Elevating the role of image under- standing in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.960188Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b7aa10a64d5a315dfd06f75e10c052af011de7c54ce1319a9e49e5082a503c8d","observation_id":"a6e7cd32-27b4-4356-92b5-47c15418a18c","resolution":{"observed_at":"2026-08-06T22:44:43.960188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.964317Z","title":"Semi-supervised learning by en- tropy minimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.964317Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:694e0cfc30226068c5a2e77f38422bdd0710f5f5c8e184140b82114ac859aaa4","observation_id":"5f8850c1-6ad4-47e1-80d6-487256dba4e4","resolution":{"observed_at":"2026-08-06T22:44:43.964317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.968612Z","title":"Projected language models: A large model pre-segmented into smaller ones","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.968612Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:2413f9e5d76757aa9001e1b1c70e33edd1ddd3745845913301b4833057879e1b","observation_id":"ef3006f6-2adf-47dd-bd74-2b0d2a27595b","resolution":{"observed_at":"2026-08-06T22:44:43.968612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.973015Z","title":"PPT: Pre-trained prompt tuning for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.973015Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:a60b04608e49fd8dd9a75cfca70977b23d93ce40667d0e47b529740af092c8c4","observation_id":"c06839e4-2587-4c38-9d9d-19c58db54669","resolution":{"observed_at":"2026-08-06T22:44:43.973015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T22:44:43.977337Z","title":"Textbooks are all you need.ArXiv preprint, abs/2306.11644, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.977337Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d0c71bb6304f3615560993ac726495423de6c3c3d55499212ad49a659a061cb1","observation_id":"bde65ae0-cc71-4d47-93ad-2d76f9fad05d","resolution":{"observed_at":"2026-08-06T22:44:43.977337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.982011Z","title":"Parameter-efficient transfer learning with diff pruning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.982011Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bdda1469b17ccc98bdfc3dd7f7eef2171db09ca01bf655db40e4f18e6d41190b","observation_id":"8535b9b1-5e36-4d82-a403-de8ddcb09be5","resolution":{"observed_at":"2026-08-06T22:44:43.982011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.986757Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.986757Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:31a60952df7f5f1f2321179bcf23d32727b63ea11406f3b51fa0b654001308a3","observation_id":"24285ebd-c1ae-4116-b986-77a679a384a9","resolution":{"observed_at":"2026-08-06T22:44:43.986757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.990606Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.990606Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bea8edf3b500526cb093f5ed039424aff9ef05da5e345814d2042c4e0d3bc390","observation_id":"15de1586-1f21-4d33-b0fe-9ee0b4185d74","resolution":{"observed_at":"2026-08-06T22:44:43.990606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.994748Z","title":"W ARP: Word-level Adversarial ReProgramming","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.994748Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:b4feacdb3863fccbde4e06d718efe407f10d21b0c3ec1f286f57a3d536b9a7bf","observation_id":"f05badb1-233e-40c7-a630-7b8038610c34","resolution":{"observed_at":"2026-08-06T22:44:43.994748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:43.998737Z","title":"ToxiGen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:43.998737Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:a0cf6a34f5889f98fdd93de22d8ba84172bbe965a567b9aa0d81543d649798c2","observation_id":"8a42452f-7e20-4234-834c-93aef0b19e51","resolution":{"observed_at":"2026-08-06T22:44:43.998737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19249","last_updated":"2023-05-30T17:35:31Z","snapshot_observed_at":"2026-07-06T15:35:33.952097Z","submitted_at":"2023-05-30T17:35:31Z","title":"Preserving Pre-trained Features Helps Calibrate Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19249","snapshot_observed_at":"2026-08-06T22:44:44.002754Z","title":"Preserving pre-trained features helps calibrate fine-tuned language models.ArXiv preprint, abs/2305.19249, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.002754Z"},"links":{"cited_paper":"/paper/2305.19249","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:25329600906207581a5089ed73928ab0c42305cbf61ca04aaea7b80c0f69a7a0","observation_id":"508e78f9-fa73-48d0-9ba2-bb3920c27b89","resolution":{"observed_at":"2026-08-06T22:44:44.002754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.007546Z","title":"Extending clip for category-to-image re- trieval in e-commerce","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.007546Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:7572a56a9c027b51ca2868c85c11d0e1381a2741f67be9d0b9d698a686b01739","observation_id":"96c7696e-858c-4660-95cc-c48eda6dea5a","resolution":{"observed_at":"2026-08-06T22:44:44.007546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.011271Z","title":"Aligning AI with shared human values","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.011271Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:72d0f98ab5d01cff10e499f72159c15f8ecef1dd82ee567aa730e9d03c00efa1","observation_id":"1d7566e4-c94a-455d-bd00-0ed6b9d6eacb","resolution":{"observed_at":"2026-08-06T22:44:44.011271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.015165Z","title":"Measuring massive multitask language BIBLIOGRAPHY 129 understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.015165Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5a76cf8a04d86a818bf5eeca22c8e830348c804f42595365a064e83f5e5ac644","observation_id":"2c76dce9-fa76-4d1c-be3a-ab352787a12d","resolution":{"observed_at":"2026-08-06T22:44:44.015165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T22:44:44.019604Z","title":"Training compute-optimal large language models.ArXiv preprint, abs/2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.019604Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9d42e40ade73f3fe97578194c13da9ca2a243df941a027acbae414d62551cd78","observation_id":"1212c0c6-a34c-4ad7-af8c-050bec2fc8b1","resolution":{"observed_at":"2026-08-06T22:44:44.019604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-06T22:44:44.024618Z","title":"Orpo: Monolithic preference optimization without reference model.arXiv preprint arXiv:2403.07691, 2(4):5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.024618Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:5c1986deba160f21524761e8933c2464b6afb38535f7dbce7fdd451620c0769c","observation_id":"89b04e8d-6a7f-4972-bd88-348b7ab06d90","resolution":{"observed_at":"2026-08-06T22:44:44.024618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.028585Z","title":"Unnatural in- structions: Tuning language models with (almost) no human labor","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.028585Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:299da0cce2d644ab97ef7f4970030f3efd18103b6c34ea31ec121ee019c6de68","observation_id":"387cd108-173b-488f-896a-efb847a5ec91","resolution":{"observed_at":"2026-08-06T22:44:44.028585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.032574Z","title":"Human feedback is not gold standard","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.032574Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:2667b1982e641ca2a6f05e9c943c2bab434c781954f88c2be421a852d8d9a24c","observation_id":"6591317c-b6fe-468d-bda6-ec2fe5272144","resolution":{"observed_at":"2026-08-06T22:44:44.032574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.036748Z","title":"Meta-learning the differ- ence: Preparing large language models for efficient adaptation.Transactions of the Association for Computational Linguistics, 10:1249–1265, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.036748Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:9f473d309b2be63b8c1d0b8e4c82a993b9c30a5a664ed92ce92751a9a280fa5c","observation_id":"d5c18acf-5c37-48fc-80c6-da3486230df3","resolution":{"observed_at":"2026-08-06T22:44:44.036748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.040532Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.040532Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:69d97d587463573e9fc89a48fef2b131828dac395d521dad48bb0dc36acaffd9","observation_id":"972d2f27-166c-4da7-8008-730a3bac1ee1","resolution":{"observed_at":"2026-08-06T22:44:44.040532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.044640Z","title":"Universal language model fine-tuning for text classification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.044640Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1eeb3910823c801a1429c4ef8930ef0adf519f2a3dd74bca954f2982fd38cf30","observation_id":"87491cae-c3a0-4940-a3b9-7ac4efb15e71","resolution":{"observed_at":"2026-08-06T22:44:44.044640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.049025Z","title":"Can llms learn from a single exam- ple?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.049025Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:cb8f1b602f866416d19b0e3208b2df8cb9f3368134277b2fac66c92d0278e1ac","observation_id":"c159ef43-dec7-4a8d-a25c-16cd0d11e52c","resolution":{"observed_at":"2026-08-06T22:44:44.049025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.053093Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.053093Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bf7ec8a28558fd05a7996ef2990acc635713691c44847aaac8c5833647bb96f6","observation_id":"070e5a04-10ca-489b-9f45-84d6e79b27f5","resolution":{"observed_at":"2026-08-06T22:44:44.053093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.057136Z","title":"Mining and summarizing customer reviews","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.057136Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1d2c3c7963ae6a8f02a3787f99a3692e84d8832f733a397a2ef6b315341595b3","observation_id":"0fe4b3bd-abe6-48bc-8d52-5a324ea9b841","resolution":{"observed_at":"2026-08-06T22:44:44.057136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.061742Z","title":"Instruction fine-tuning: Does prompt loss mat- ter?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.061742Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:83d07b812694e6ec3bfc9d80d4224d3652e653ba9f6d8739788fe5a14bf282a9","observation_id":"f5bda0a5-dc72-4678-a121-4455a329f013","resolution":{"observed_at":"2026-08-06T22:44:44.061742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-06T22:44:44.066010Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conver- sations.arXiv preprint arXiv:2312.06674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.066010Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:d903d348493ffee33c72fb39e2feadaebd19751ca4018f0b2754f8ad09c6b462","observation_id":"8bb9cdef-5d9f-4a89-bffc-0f18e730a2b8","resolution":{"observed_at":"2026-08-06T22:44:44.066010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.070392Z","title":"Hyperdecoders: Instance-specific de- coders for multi-task NLP","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.070392Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:dea45716e333a9c4763140b0065bc6f5ce7259f8f3401aa79efc1b209f452b75","observation_id":"8fc32d23-017b-4d41-aa13-4f3505d20fe2","resolution":{"observed_at":"2026-08-06T22:44:44.070392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.074811Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.074811Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:8c21c97195a725c55bc0428a1884fa624b73e81bd6c132e543a4e2c660986237","observation_id":"03ee083b-576c-4b2a-9424-5ee6b357137d","resolution":{"observed_at":"2026-08-06T22:44:44.074811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.079269Z","title":"Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Aniruddha Saha, Micah Goldblum, Jonas Geiping, and Tom Goldstein","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.079269Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:575aea93ebd09218d557c1675935e0fa62ff0b82b04a1951b74141d1ce2e9c43","observation_id":"d50d8371-1ccb-4c20-b3e7-6f0c7d166ac6","resolution":{"observed_at":"2026-08-06T22:44:44.079269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.083308Z","title":"Representation learning for grounded spatial reasoning.Transactions of the Association for Computational Linguistics, 6:49–61, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.083308Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:fe1c9cf6eeee449532cd0d8bbabcd4afc98a8023d1801ed2b05baf9738a4b3e5","observation_id":"fa6bd133-d5a4-4ccc-ac10-fbff2c2ca7c9","resolution":{"observed_at":"2026-08-06T22:44:44.083308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13133","last_updated":"2023-11-22T03:37:01Z","snapshot_observed_at":"2026-07-06T16:50:54.684296Z","submitted_at":"2023-11-22T03:37:01Z","title":"LIMIT: Less Is More for Instruction Tuning Across Evaluation Paradigms","version":1},"cited_work":{"arxiv_id":"2311.13133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13133","snapshot_observed_at":"2026-08-06T22:44:45.460894Z","title":"LIMIT: Less Is More for Instruction Tuning Across Evaluation Paradigms","venue":"cs.LG","work_id":"c08a7774-68b5-45d7-8e7a-53ef9695c5de","year":2023},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.087462Z"},"links":{"cited_paper":"/paper/2311.13133","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:1e4a2e446d6a90156d9e7846f6d5ae6aa11162dc666ccbb89cd9890fe8752a79","observation_id":"452c341f-57e9-48ef-aed8-cb4f10f2dc73","resolution":{"observed_at":"2026-08-06T22:44:45.465717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T22:44:44.091445Z","title":"Scaling laws for neural language models.ArXiv preprint, abs/2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.091445Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:bf1156b707424390b3845be7cf48ce68232f189044673fddc1f4b471cf8d7732","observation_id":"013171b2-3b55-4642-b22c-d29254e49371","resolution":{"observed_at":"2026-08-06T22:44:44.091445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.095688Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.095688Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:92c9cb09eb39094654aef1cb657e989ed470d98c1ab08a6c2f635bb344ed22a0","observation_id":"58e56958-bd20-4f8c-aa66-aac08c5718fb","resolution":{"observed_at":"2026-08-06T22:44:44.095688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.099652Z","title":"Looking beyond the surface: A challenge set for reading compre- hension over multiple sentences","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.099652Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:7532a8b59ea22ef1a37ec39d732197b6ea182d90ccc1131af149e5e077e28dc3","observation_id":"df9ceb9b-f737-4228-b364-74eb76ee197b","resolution":{"observed_at":"2026-08-06T22:44:44.099652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.103686Z","title":"UNIFIEDQA: Crossing for- mat boundaries with a single QA system","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.103686Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3eb640e09dc20aea0c66cc327543e7b7e1e0e1b24762314d6629c73afe36b4ff","observation_id":"418a7124-be8a-43ae-a98a-c33d2d53fdeb","resolution":{"observed_at":"2026-08-06T22:44:44.103686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:44:44.107619Z","title":"Scitail: A textual entail- ment dataset from science question answering.Proceedings of the AAAI Conference on Artificial Intelligence, 32(1), Apr","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T22:44:44.107619Z"},"links":{"citing_paper":"/paper/2506.20917"},"observation_digest":"sha256:3e4002a7c90c908db980c47b0521339cad099827dc84ab06104cbfc760df46bb","observation_id":"e69bab42-9f29-4524-b3f9-ec54819353d3","resolution":{"observed_at":"2026-08-06T22:44:44.107619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20917","last_updated":"2025-06-26T00:49:35Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T05:17:23.851973Z","submitted_at":"2025-06-26T00:49:35Z","title":"Optimising Language Models for Downstream Tasks: A Post-Training Perspective"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":98,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":277},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 277 outbound references and 0 inbound Pith citation observations for arXiv:2506.20917."}