{"as_of":"2026-08-22T14:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:726a253cd8248d60897a802c4fe97408341a49918a217d54a2dc12b09ba6473f","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:07:20.866024Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07812/citation-record","integrity":"/paper/2412.07812/integrity","json":"/paper/2412.07812/citation-record.json","paper":"/paper/2412.07812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.771312Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.771312Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:68defa95cfc45473597bd409105d0fc96f530b4805f06c72f5cbc981bcf73a13","observation_id":"9caeb701-2330-4e05-a341-e754f1a175f0","resolution":{"observed_at":"2026-08-11T19:07:20.771312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T19:07:20.775640Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.775640Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:c196c4b14f8610c2beb094deb161d45cf392b1943c00a6bfac37efa7a7a87812","observation_id":"613624ee-1b39-4b9a-92a7-0420c29e434b","resolution":{"observed_at":"2026-08-11T19:07:20.775640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T19:07:20.779754Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.779754Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:75d072994e0f16a72d627b5619e3579dcee3cc581b1a30e20165f2ecfdc73f3b","observation_id":"c2b02f2b-94b1-49cd-95c0-355a794cfb9e","resolution":{"observed_at":"2026-08-11T19:07:20.779754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.783894Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.783894Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:d8f2b999ec4b32d738717dbab94356343bbc5993853a1e10c2d2be30ce00c80b","observation_id":"97c807b5-264a-4f60-b736-2aa27392028f","resolution":{"observed_at":"2026-08-11T19:07:20.783894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.787649Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.787649Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:081bdadd5e0bd2a8ed83ed498eb6d78b7bd6b4c51262576558c8f942617e4e36","observation_id":"8644ba4c-c802-4924-a782-106bcfe14283","resolution":{"observed_at":"2026-08-11T19:07:20.787649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.791296Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.791296Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:bfd4e01ca9dbe87a95ac871f1f32c8c012297d8cf2acd2577a36bc70bf1c18d5","observation_id":"358f491b-c243-4e2a-a117-9e52b4fa6aae","resolution":{"observed_at":"2026-08-11T19:07:20.791296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.795123Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.795123Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:70a359f5bf451d512cd5ce4e80476ce17420b3b68f958ccca961c5415de18c0c","observation_id":"bd713223-8f1a-4ff4-8894-678e4f6aff7d","resolution":{"observed_at":"2026-08-11T19:07:20.795123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.107240Z","title":null,"venue":null,"work_id":"9863205f-3922-45c6-b0db-7b1a24552671","year":2024},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.798359Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:b666e37fdf3d13e8f3254dceb375065381f0fbd567902b208fa46b4b35bea15e","observation_id":"9bb7314b-e3fb-4ee2-aa82-879df548e19a","resolution":{"observed_at":"2026-08-11T19:07:21.110860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.802864Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.802864Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:ca340a59c52eebe321fe159f39fab7961082ef5a065e26195e4b0f28cb82d60e","observation_id":"e1d9e01a-83f7-4a64-a874-e49cf931686a","resolution":{"observed_at":"2026-08-11T19:07:20.802864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08215","last_updated":"2023-06-06T13:09:21Z","snapshot_observed_at":"2026-08-21T02:53:28.378999Z","submitted_at":"2023-02-16T10:59:39Z","title":"Aligning Language Models with Preferences through f-divergence Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08215","snapshot_observed_at":"2026-08-11T19:07:20.806229Z","title":"Aligning language models with preferences through f-divergence minimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.806229Z"},"links":{"cited_paper":"/paper/2302.08215","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:bd59b003aad7e3bf92b85d4a208e9dc239974ec3d997f4b28cd4cc3a47c26a71","observation_id":"77c50258-0391-49d3-8171-609534ff4ff2","resolution":{"observed_at":"2026-08-11T19:07:20.806229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.089306Z","title":null,"venue":null,"work_id":"14515a79-8c9a-4c1c-bcee-5343ec13aa85","year":2022},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.809938Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:8c9da34e2efb3c5cc0d741a9e68f77687f50cd0b20ccd6b091718fb35d1c239b","observation_id":"6d717c9d-f1e8-43d0-9949-8dfa75233328","resolution":{"observed_at":"2026-08-11T19:07:21.092716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-20T03:06:00.034814Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-11T19:07:20.813062Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.813062Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:f91e378895f36faca624925d3e6736cb80452f8057ae89b3babe0b302123d31a","observation_id":"91585a72-b80e-4fff-8fb1-2eb24feebaee","resolution":{"observed_at":"2026-08-11T19:07:20.813062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.078406Z","title":"Reinforcement learning by reward-weighted regression for operational space control","venue":null,"work_id":"61f477f4-22c6-4138-bfe2-836cf015c0f8","year":2007},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.816806Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:519e6feb879c948d5f92ada41314039c74fafa0345683fa082c02bf8098996ce","observation_id":"8548cd89-6def-42b2-8c7e-436a66d4991f","resolution":{"observed_at":"2026-08-11T19:07:21.082436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-11T19:07:20.819971Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.819971Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:61acdf21db60adbed196078ee5d9a32b703bfe8fe7581cffd873d50bb13e9593","observation_id":"85d301e9-ea8d-4477-a9b3-ee73db5c6136","resolution":{"observed_at":"2026-08-11T19:07:20.819971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-11T19:07:20.823371Z","title":"Self- rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.823371Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:1a0041b22ac2495b04547a183eb581230df27ff2abba97e67426b137ed31b040","observation_id":"313c4c64-c3f5-4086-a3c6-a8544adced1f","resolution":{"observed_at":"2026-08-11T19:07:20.823371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.068037Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":"c1e51802-3dd8-490b-a0c5-2633968fb62d","year":2024},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.826942Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:adba20894a301ffc67868db736abf6398ea725f18df721dba01e6c37602fa274","observation_id":"7426cb66-84b2-4892-804f-ce2e0bec140a","resolution":{"observed_at":"2026-08-11T19:07:21.071639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.055574Z","title":"Aligning large language model with direct multi-preference optimization for recommendation","venue":null,"work_id":"a2657639-a92e-47dc-b368-a0b5a0089354","year":2024},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.830611Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:ee216cf7dceb36816432b49333b9e4c39fc3bdb96c3762f749968b537ccacc1f","observation_id":"7dcfaf01-ec37-4599-bcd5-aab0accc7604","resolution":{"observed_at":"2026-08-11T19:07:21.060397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.043874Z","title":"orca_dpo_pairs","venue":null,"work_id":"8953c122-6cf2-4938-bc80-8489ea86c162","year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.834311Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:f68c646a50dc2b9b0d46e560709c911981d2cac56d76a700d14596852a5fb204","observation_id":"db3b36ae-6137-450a-877b-b7b68b31c6b8","resolution":{"observed_at":"2026-08-11T19:07:21.047920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.837707Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.837707Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:5759b5076752f96b7ed0605138e717bf47af06bf69ddc5aefbf6caf42156bd6f","observation_id":"e6ccc5b0-3c7e-4723-b0a0-bf3b355a0096","resolution":{"observed_at":"2026-08-11T19:07:20.837707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-11T19:07:20.841083Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.841083Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:f352f1c25b67fda8b424f477dec4b7586fb0a3911bcf915a4f0d76582c7fcb0c","observation_id":"a06d4da0-5c14-436f-b6d9-f9cae2dfed13","resolution":{"observed_at":"2026-08-11T19:07:20.841083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T19:07:20.845171Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.845171Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:0c76f0da7919d1e54f890f45af34ca25bbd08fa5413007eca1243fce6ce708a5","observation_id":"e6727376-ea2f-4f43-9981-774ad46a2789","resolution":{"observed_at":"2026-08-11T19:07:20.845171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-11T19:07:20.849412Z","title":"Deep compression: Compressing deep neural networks with pruning, trained quantization and huffman coding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.849412Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:a8394d5b5a4607b604a5e705e69542782959dcb9ada8f19107ce54ccbc7946f8","observation_id":"641784d1-7b41-4cb6-a44b-aa5b6b7b7b1b","resolution":{"observed_at":"2026-08-11T19:07:20.849412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.853679Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.853679Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:c199f65205b03cdcefa2fb4eb310ed7511c8d4519a846c79daabe222ab7ca8aa","observation_id":"f906b717-4657-461c-a7ad-4ebd4ae96a25","resolution":{"observed_at":"2026-08-11T19:07:20.853679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:21.017372Z","title":"Hashimoto","venue":null,"work_id":"f7ae66c6-ca66-4e1b-b637-23bc70a984e5","year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.857852Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:a7c324cbedaa3a21063cccf22549fbf9dc5a4e4d7bd174b3bf6e83cf2ce9d758","observation_id":"f3dc527c-7859-4971-bd79-27d21c33c307","resolution":{"observed_at":"2026-08-11T19:07:21.021275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.861953Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.861953Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:b1e5e33c915bb486a231dfa23560987b84d39dd90b50f15ee0535bfec456d92f","observation_id":"2179e772-8dac-4f21-89c2-3939ea704843","resolution":{"observed_at":"2026-08-11T19:07:20.861953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:07:20.997532Z","title":"sample instruction,","venue":null,"work_id":"26c84f60-e331-427b-9632-44c492154e9c","year":2023},"citing_paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:07:20.866024Z"},"links":{"citing_paper":"/paper/2412.07812"},"observation_digest":"sha256:5c6ecffac393da5af0bd3fa736caacf7f30ab6f56a047ee1ce98b9cb55812b7c","observation_id":"f34206cd-5e88-44d1-aa28-d8f76d6ac1cc","resolution":{"observed_at":"2026-08-11T19:07:21.002341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07812","last_updated":"2024-12-10T05:45:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T22:15:25.468209Z","submitted_at":"2024-12-10T05:45:36Z","title":"Multi-Response Preference Optimization with Augmented Ranking Dataset"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2412.07812."}