{"as_of":"2026-08-15T12:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfd05d533fb50e596eac71dadff58af9f89012dd9f1073996a7e763eb1df7f30","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:15:11.185463Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:38:48.719839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T22:38:49.070684Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"cited_work":{"arxiv_id":"2412.08147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08147","snapshot_observed_at":"2026-08-10T22:38:49.070684Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","venue":"cs.LG","work_id":"e8ed77c3-f806-4a6e-9b2f-b8b70ef3a70e","year":2024},"citing_paper":{"arxiv_id":"2501.01230","last_updated":"2025-05-26T13:01:08Z","snapshot_observed_at":"2026-08-15T03:51:53.442640Z","submitted_at":"2025-01-02T12:45:21Z","title":"Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:48.719839Z"},"links":{"cited_paper":"/paper/2412.08147","citing_paper":"/paper/2501.01230"},"observation_digest":"sha256:7ab70c3c386c236ce95daae906f6d6fd3d0bcc20b82549f9f5caa8faec1ccf6c","observation_id":"2c191934-7008-4577-9c07-7205e8fa5185","resolution":{"observed_at":"2026-08-10T22:38:49.074989Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08147/citation-record","integrity":"/paper/2412.08147/integrity","json":"/paper/2412.08147/citation-record.json","paper":"/paper/2412.08147"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.730523Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.730523Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d311373d4f82e29cec5c1db94c58e1d3324da08951ac911d927b23b6be57ebb5","observation_id":"395755ce-a8b7-4cf9-9dfb-08a3d245f1ba","resolution":{"observed_at":"2026-08-11T18:15:10.730523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.909708Z","title":"Muppet: Massive multi-task representations with pre-finetuning","venue":null,"work_id":"16d3f136-85ef-4614-940c-afb26d410e3b","year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.737695Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:e20f2bfd1834b63d6f7f3e2e4797312b1647d51f5c2f59a3b282b5042a51404f","observation_id":"964b5bda-5aeb-4d6e-8f45-272fa8877e9f","resolution":{"observed_at":"2026-08-11T18:15:13.917923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.861037Z","title":"Safety-tuned LL a MA s: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":"6bf1092e-5262-467b-981e-9c4fd1dae1a6","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.743431Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:224ad2db9a305222e2204a098b426f97a0a1af022b351d8fcb79b97c993c0b72","observation_id":"0e954d8c-e2b0-4e09-bfb8-138d5095de3f","resolution":{"observed_at":"2026-08-11T18:15:13.877649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.830747Z","title":"Neural networks for pattern recognition","venue":null,"work_id":"62c6b2bb-8ef8-459c-95d2-43bb831d46c7","year":1995},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.750856Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:66397e5d73cac7113238016713029f36567def051a782ca63129b0fbff9901d4","observation_id":"0b35ded3-ba47-40aa-b1b3-a6976ba82b26","resolution":{"observed_at":"2026-08-11T18:15:13.839602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.758533Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.758533Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:52c833174a3251efae0b7ea94727c48e997c3787f39ef714a526aa21aad4004e","observation_id":"de994e55-adbb-4314-b309-acbb17e2bb7b","resolution":{"observed_at":"2026-08-11T18:15:10.758533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.800948Z","title":"Mode-finding for mixtures of G aussian distributions","venue":null,"work_id":"556b8789-c405-47f4-9345-e1296cd3b24c","year":2000},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.765228Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:2c5869edca4997f9a75c29ca7aa57ec525b9ab6c9150ab05479d5f426911a656","observation_id":"3d774df1-e3d0-4e8c-9950-48a0ca900174","resolution":{"observed_at":"2026-08-11T18:15:13.809183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.771952Z","title":"Multitask learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.771952Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:7650d465c80b6844bfd6c8b8c2d5b7ca78c64ac45fb749a6be49b7c95d8c2135","observation_id":"18c311c5-d512-4450-b645-bc3a55f4abe4","resolution":{"observed_at":"2026-08-11T18:15:10.771952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.769172Z","title":"PAC-B ayesian supervised classification: The thermodynamics of statistical learning","venue":null,"work_id":"ccc7bcfe-ee95-4ffa-af05-51d64e062952","year":2007},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.780121Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:1e8ab7d37e38acd996a9233f90f0a4397bc8a8517e0cd753b43e183a65ab2af7","observation_id":"84cd8a65-06e0-402c-855d-eb11a7205484","resolution":{"observed_at":"2026-08-11T18:15:13.781424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.725485Z","title":"Overview of the IWSLT 2017 evaluation campaign","venue":null,"work_id":"7e73e63e-b03a-4a33-92f9-4bf655cb37e2","year":2017},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.787548Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d97b4b4c1e56e95ba8b013af53b3b0de6a1029b53c5e00f3dea2d2bf0b44b0d4","observation_id":"6fa95463-b68c-4400-805a-98fa617405d3","resolution":{"observed_at":"2026-08-11T18:15:13.739210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.694848Z","title":"GradNorm : Gradient normalization for adaptive loss balancing in deep multitask networks","venue":null,"work_id":"ed7f011e-74a3-48fc-9f71-a5b8d387705b","year":2018},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.795884Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:e23fb10014872e56ad2c120c7f3be236b386d9ce64ae719bbf88373593dea310","observation_id":"12efde92-4baf-4f4d-9937-f47678ccfd7f","resolution":{"observed_at":"2026-08-11T18:15:13.704671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.805911Z","title":"Remote sensing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.805911Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:fa1aca0d502a34238e98ac456c81eb8c05fd4bb90c212fd0d7226e23ab18a434","observation_id":"020759e6-28e3-4368-8781-18109fdb74a8","resolution":{"observed_at":"2026-08-11T18:15:10.805911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.672163Z","title":"Zhao, Yanping Huang, Andrew M","venue":null,"work_id":"14414d89-a47f-4baa-8332-c40290ae4cfe","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.812381Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:93ca3945dba70625bb89e7e4145f340f377a0b2a994e01270266901c1f6555a3","observation_id":"b746629e-d543-4e30-a57a-d7ff5ec90582","resolution":{"observed_at":"2026-08-11T18:15:13.679730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.646268Z","title":"Model merging by uncertainty-based gradient matching","venue":null,"work_id":"4baa7535-b43f-4a6b-a5f1-d4834aaf9012","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.820287Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:bcd3a691fa4ca271475cd7239548f9071bedb83bf93fb97c6477792bee0a5b52","observation_id":"67ca8381-9653-4ef4-a298-33ec930f966a","resolution":{"observed_at":"2026-08-11T18:15:13.655628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.614826Z","title":"ColD fusion: Collaborative descent for distributed multitask finetuning","venue":null,"work_id":"f8717b7d-0ac4-435c-aec9-c525dbe8684d","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.829496Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:bc97f1545b2f56a32b9a612641c84c3e089b1d5ada54ed8f9babaeb792ef31a6","observation_id":"7179bd36-8525-43e5-a84e-3d89372e9c13","resolution":{"observed_at":"2026-08-11T18:15:13.623970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.840168Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.840168Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:e235d6b0a3d12555f674ab3fb522141f4fc6889629faddb957df4a5ac6c3ce08","observation_id":"c2553b3d-71bd-40d3-950a-2e55aaecec7c","resolution":{"observed_at":"2026-08-11T18:15:10.840168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.564395Z","title":"GLaM: efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"9fea0176-bcda-4c44-9105-eea7c9e0c4c2","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.850405Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:8f6a2671ff7125d39619027a14436cf92db5c1b5c809333c6515ef0a0e281e85","observation_id":"a46855af-b8df-4a75-b6c4-9bbb0d9283d2","resolution":{"observed_at":"2026-08-11T18:15:13.576240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.536636Z","title":"Durrant-Whyte and Mike Stevens","venue":null,"work_id":"68cced0a-1a71-4127-bf8d-b498bd4abd02","year":2001},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.858209Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:f1943f1419f97e085c44b616cff0b0384f1ea3dfa561cce40fe8a9de48309385","observation_id":"96aab1cc-4881-41ab-a5b4-8666dc84a3f4","resolution":{"observed_at":"2026-08-11T18:15:13.544903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.512191Z","title":"Knowledge card: Filling LLM s' knowledge gaps with plug-in specialized language models","venue":null,"work_id":"6c2cabcc-30eb-452e-bfb5-52f56b8cfe62","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.865222Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:998c323f64080e0d4bceb5412520ae97af48da52d5ca2036f7945e397200f284","observation_id":"7db04345-154f-4cc2-9c3b-8e329aeeceaf","resolution":{"observed_at":"2026-08-11T18:15:13.519976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.479717Z","title":"Continual pre-training for cross-lingual LLM adaptation: Enhancing japanese language capabilities","venue":null,"work_id":"355c582f-2a66-454b-9a04-c4397227f9f6","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.873089Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d448eff8c01fb5345374c2607ef3692ed4fdd608d06038910ecf65e0a2ecb808","observation_id":"82690596-fd30-4d45-8362-8dae36fbafe3","resolution":{"observed_at":"2026-08-11T18:15:13.488184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T18:15:10.879522Z","title":"Gemma 2: Improving open language models at a practical size, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.879522Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:5621b44dd06d96d1b2f2c79e550b31a815ec297008dbed1c6cb8577d25480006","observation_id":"557a0e26-fc38-49c2-9823-140db3640a15","resolution":{"observed_at":"2026-08-11T18:15:10.879522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T18:15:10.886248Z","title":"Gemma: Open models based on G emini research and technology, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.886248Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c449e6b4672fe19b83a48145bd6cf3d26e92763e80fa2fa41d7f6028cf905fb3","observation_id":"a6795780-5525-4f77-89a1-277feca12c6a","resolution":{"observed_at":"2026-08-11T18:15:10.886248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.453983Z","title":"Multi-loss weighting with coefficient of variations","venue":null,"work_id":"182d0c4b-fd1f-4e5b-a323-42be04771f20","year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.894295Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c727130ccc505ab229493db9d2faf60e4e47f3a062311cedd3834c6c42ca3d70","observation_id":"81bc45e0-b04c-4bba-8969-4468630855b0","resolution":{"observed_at":"2026-08-11T18:15:13.461074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.900181Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.900181Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:157e3cb7192cd885fa11528f668b840f323ef3b902dcae232385153b09ad0b22","observation_id":"1183bd3c-63b1-4443-9971-171e25a6ffe4","resolution":{"observed_at":"2026-08-11T18:15:10.900181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/8519248","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.295883Z","title":"Euro SAT : A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"be1da2e5-b8c1-4f5e-a0c2-80181bf47aa3","year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.907746Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:1fbd49e7cb972acece4ea266d01fbb2dc2e5950a43184463d933f83e1895dc10","observation_id":"c1a94f2a-443b-4dcd-944e-13ad64eb79ec","resolution":{"observed_at":"2026-08-11T18:15:12.306623Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/6706807","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.102893Z","title":"Detection of traffic signs in real-world images: The G erman T raffic S ign D etection B enchmark","venue":null,"work_id":"e790317d-e91c-41e2-98a5-6e84ccbe854a","year":2013},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.913625Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:2d58f17aa8655907264a0fc307ca0ae6248fdb1d07e6b421cd30803c77d30902","observation_id":"c0d203fc-989a-4dd8-86ef-e7c0ef3ce1d2","resolution":{"observed_at":"2026-08-11T18:15:12.120608Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.427246Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":"a245261c-9b41-4de9-8896-49a4748304eb","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.919559Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:6c53a65af6a30c42c72145c6c46a9587e32604dec4d3e1944924658d1e30f415","observation_id":"572c2ceb-c933-4c12-ab1f-bd6df9ee96c8","resolution":{"observed_at":"2026-08-11T18:15:13.434148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.404980Z","title":"Editing models with task arithmetic","venue":null,"work_id":"b90b27e0-48aa-4659-8291-d78d68ccd28a","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.926694Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:1644fe8fe2480996345731a5677b89c657303138d3b622d67065bb9dc5b1f069","observation_id":"f5eff7f6-483d-418f-afb6-437de8b88dc5","resolution":{"observed_at":"2026-08-11T18:15:13.413070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15361","last_updated":"2024-09-18T08:04:24Z","snapshot_observed_at":"2026-08-12T22:42:40.335825Z","submitted_at":"2024-09-18T08:04:24Z","title":"Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15361","snapshot_observed_at":"2026-08-11T18:15:10.933257Z","title":"Multitask mayhem: Unveiling and mitigating safety gaps in LLM s fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.933257Z"},"links":{"cited_paper":"/paper/2409.15361","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:ae83c15bf596d33069defd3184f7f30ce7287ee1311e4ba1b54a91f5d3048727","observation_id":"5c23cc78-7eea-49ca-9fe6-e439d8f52599","resolution":{"observed_at":"2026-08-11T18:15:10.933257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.372183Z","title":"ForkMerge : Mitigating negative transfer in auxiliary-task learning","venue":null,"work_id":"50437a14-5956-4ac9-83bf-7de38a9aaec9","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.940131Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a3853d3ce25f4cadc69df085958e0b8a2294238ae523fc2c35b324e48319b1e8","observation_id":"7159d9cb-459c-40fc-9ebd-39ce6e83583b","resolution":{"observed_at":"2026-08-11T18:15:13.380992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.332363Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"91a83c57-eac4-4e3e-b3c1-8f9ed456f4ab","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.947644Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a0f4786baf7cfbd0c4122ceb64eba2164f71a82de3eb251f3fe33dec5f215279","observation_id":"710b5c2c-3aca-4774-b597-a91a5cea8dca","resolution":{"observed_at":"2026-08-11T18:15:13.342746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.291845Z","title":"The B ayesian learning rule","venue":null,"work_id":"26c8ea40-3881-4402-9b78-5e782c8c5af1","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.953903Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:03ce14273960e376ebba1742a619409720f8c32142e644e8f5efb3f203d816bd","observation_id":"52f24e98-7fbd-4fdc-9b91-53599770f4bb","resolution":{"observed_at":"2026-08-11T18:15:13.301085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.264004Z","title":"Fast and scalable bayesian deep learning by weight-perturbation in Adam","venue":null,"work_id":"4ce11685-35c1-4941-b881-c06df54b5107","year":2018},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.962011Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:fa3d683d430236da672a281f35c2ca75852c877be7a41a74b2bf4d7bee185afd","observation_id":"8fda7099-3acd-4845-bf22-4f159185ae92","resolution":{"observed_at":"2026-08-11T18:15:13.272196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.970832Z","title":"3D object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.970832Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:1053214bc346c357a9678ffc7bd117df5dba6db9e3038fb2c2ac5b6c34514fa4","observation_id":"485c367c-903d-41ef-a06c-9ff3e7bb601e","resolution":{"observed_at":"2026-08-11T18:15:10.970832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.230629Z","title":"Fast and simple natural-gradient variational inference with mixture of exponential-family approximations","venue":null,"work_id":"83e85713-c36b-4452-82ea-fd0c2fcdf35f","year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.976303Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:1004a6a038bdc2f15dcb1f78705e6d723030f2287488b941880bd487f5caeb44","observation_id":"9b844140-3071-4f67-aa83-a82d2194c4c7","resolution":{"observed_at":"2026-08-11T18:15:13.242617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02303","last_updated":"2023-11-04T02:22:40Z","snapshot_observed_at":"2026-08-13T05:33:03.893916Z","submitted_at":"2023-11-04T02:22:40Z","title":"MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02303","snapshot_observed_at":"2026-08-11T18:15:10.982181Z","title":"MFTCoder : Boosting code LLM s with multitask fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.982181Z"},"links":{"cited_paper":"/paper/2311.02303","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c6ab0dc9589cadb980c669a2dd916eaf1ac71cda9448b87339d287ecfd9acf1b","observation_id":"f98c6fc2-88a7-4804-ace3-584a4bf49310","resolution":{"observed_at":"2026-08-11T18:15:10.982181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-11T18:15:10.989779Z","title":"RoBERTa : A robustly optimized BERT pretraining approach, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.989779Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:44fc046a2969bbbb2ca0254f72a492cf9329da8ca0d3aee02cb0d7dcef278cdd","observation_id":"74a37287-ab42-4f70-94a1-ed5ce9090c0a","resolution":{"observed_at":"2026-08-11T18:15:10.989779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.996890Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:10.996890Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:4634e2d78465a5821b2d4f57eb7f751f05d167da855f177b1bad256c27ad0d9a","observation_id":"8c533a58-f88e-41f7-9cf2-fbe53f4d06d8","resolution":{"observed_at":"2026-08-11T18:15:10.996890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.174389Z","title":"Maas, Raymond E","venue":null,"work_id":"bf9846da-4d35-4843-bacd-c0113c8cc253","year":2011},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.004139Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:73ec670db6e32b3f0d8c4d055271cfef19895d9cd72d2924282d11a04bbb777b","observation_id":"fea2f85d-a94f-4872-ae6f-11c520ffe25c","resolution":{"observed_at":"2026-08-11T18:15:13.182130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-08-12T22:38:28.195671Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-11T18:15:11.010961Z","title":"Guerreiro, Ricardo Rei, Duarte M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.010961Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:97b5fbefad10490284b2aa98a54846443340ecc98d8a0a6e54338b55d6a2e9d7","observation_id":"0bcd4f09-389d-4ca9-a158-77b305fec2c1","resolution":{"observed_at":"2026-08-11T18:15:11.010961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.137865Z","title":"Merging models with F isher-weighted averaging","venue":null,"work_id":"df3430e7-e3da-4775-8cd3-0306a174d154","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.018531Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:5ddc4a4d782b15b2a98382e870a8bbbf5e14e8792e2b477f154c5fd8bc4dddb0","observation_id":"3fa8acdd-d773-454f-862a-c982f0af8528","resolution":{"observed_at":"2026-08-11T18:15:13.145525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.024309Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.024309Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d638d1d5d4a846cbbd9a1fc4aed69992ab3c11aaec6478f78697f60b0e47802d","observation_id":"f98b26df-4d7c-4dab-bb20-a2440de62d48","resolution":{"observed_at":"2026-08-11T18:15:11.024309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"book/9780849","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.696579Z","title":null,"venue":null,"work_id":"ee3d89fa-c963-45d2-b314-0936f4c2c53f","year":1998},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.030817Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:3024797651dc12b3de2ee8aed7b9335719fafe6a0aa559522a9ed96367735aae","observation_id":"e469d320-642d-4df6-a0ad-027c149e448c","resolution":{"observed_at":"2026-08-11T18:15:11.708518Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.109415Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"019ae74b-4d85-4d15-94ec-a92383e4d8a0","year":2011},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.038823Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d976fdb98caf94a06edfec3b915d131ccf82fab0b1c9ec71cdf115328f7cd835","observation_id":"ad718209-7434-42be-a598-4f2e7c83f624","resolution":{"observed_at":"2026-08-11T18:15:13.115920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.045381Z","title":"The variational gaussian approximation revisited","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.045381Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:29747981c2567f45e44f0d3fa313f0f9446ea520f90771870c87d8e62a253c6b","observation_id":"ac059a11-33d3-430f-8586-0df75f5a2bfb","resolution":{"observed_at":"2026-08-11T18:15:11.045381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.058756Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models","venue":null,"work_id":"8b69ea93-243a-4d08-ba06-500f3f587274","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.050804Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:ad3a8631e98e11911188abb4ebb3fec00d6bb956fd0fe267e7e967e05f5a2e66","observation_id":"5647c61b-0e2a-477b-8edc-4ffd8649f13d","resolution":{"observed_at":"2026-08-11T18:15:13.070218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:13.033732Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"366238a9-f8c6-4ef1-a953-27180bde86ff","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.059099Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a0e4bb600481186b4381dff5c225ac2eb7802791c3d961a90ae8b65e720f5b47","observation_id":"9f8a06f5-d6a4-4b8b-9474-c4fde8e006ee","resolution":{"observed_at":"2026-08-11T18:15:13.042210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.997033Z","title":"Seeing stars: Exploiting class relationships for sentiment categorization with respect to rating scales","venue":null,"work_id":"4f22ad15-baec-47d6-8f0c-b7c1f0bd9339","year":2005},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.065388Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:4acea8b06f7687a1893dca44937dd444b0532062416a004f14d181b2fabd32a1","observation_id":"b8e9ae59-116f-4e3a-95ae-c74eb59673b0","resolution":{"observed_at":"2026-08-11T18:15:13.006404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.960535Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In International Conference on Learning Representations (ICLR), 2024","venue":null,"work_id":"29e3cb21-8abf-4747-9014-1e83ffe31c1f","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.072473Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a824211f768ee4887b667035ca59e87ca1ac656e56e7aa57d046e0c41c13f7ba","observation_id":"c5436ae4-1b90-417c-ba7d-a69db06a26d5","resolution":{"observed_at":"2026-08-11T18:15:12.968269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.935204Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"73bef672-2691-4a20-9a9f-7db11a0e5cae","year":2021},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.078934Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:e978403f1f00f7b4981a41f8c20e318fe3a9aaf5b82442e290187dec4f05016e","observation_id":"6baa1d97-31aa-4c8b-a2f8-46c822a4b443","resolution":{"observed_at":"2026-08-11T18:15:12.943881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.897503Z","title":null,"venue":null,"work_id":"1c463717-dc1e-497b-a19b-43f7d9ed9ea0","year":2020},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.085942Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:52a98f41d23984add476e5b2f6f1be2daa28480089115520c07f3bf7f1bca294","observation_id":"9eec02c0-f56e-4f67-abef-976c2257cc97","resolution":{"observed_at":"2026-08-11T18:15:12.907624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.869362Z","title":"Learning to reweight examples for robust deep learning","venue":null,"work_id":"d71dd6cb-c910-4344-b5f7-2c33c67e9a27","year":2018},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.093757Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c625fddf939f2e60faad888a6590e53d37634dd7a5a8e76fdcd0112590dd3b4a","observation_id":"b0c52ace-ab0d-4a77-bd1a-98b00360b063","resolution":{"observed_at":"2026-08-11T18:15:12.877091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-13T21:53:02.384757Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-08-11T18:15:11.101238Z","title":"An overview of multi-task learning in deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.101238Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:9af494dd0deb051758ea10f1d0139f373060e8e3c1f71f900f09febebec2a958","observation_id":"bd4f4ced-f41a-442a-b3a5-228868419e38","resolution":{"observed_at":"2026-08-11T18:15:11.101238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.829060Z","title":"Variational learning is effective for large deep networks","venue":null,"work_id":"bf24e597-2d89-45cf-96ad-56a592227b00","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.107479Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:3e9c5c18df8b0dd7976e3bd5079e6bba59458e315a260b023df0a511c76767fc","observation_id":"19f589c9-c697-428a-a2d7-deafa1fc82c7","resolution":{"observed_at":"2026-08-11T18:15:12.841471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.793482Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"7133778c-bfda-408b-a99f-ad7764e9aec5","year":2013},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.112906Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:12b94f1f643ec5bbfe97c8d67cea15b4b9cb1b035d2b67fba97319b965a98de6","observation_id":"5450d75e-ee04-4d28-bdd3-7c9bff97333b","resolution":{"observed_at":"2026-08-11T18:15:12.801207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.763583Z","title":"ZipIt! M erging models from different tasks without training","venue":null,"work_id":"08efd12d-3ce2-4f93-9063-732db039f6b5","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.119063Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:831bec12cf9966ec1d523a2c9cd827d4340af1a01b9a31bca8a9ce4dd32e8c36","observation_id":"8e03159c-696c-4e1c-b959-13f944dabfaf","resolution":{"observed_at":"2026-08-11T18:15:12.771096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.730169Z","title":"Self-influence guided data reweighting for language model pre-training","venue":null,"work_id":"a1cbfd6c-40d7-421d-a242-55ec946153ca","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.124939Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a843084ab068f98e4f33853fdde3735f4f1db7c077fdbf219e3012e86d799eb9","observation_id":"9a1db191-e886-4f29-84d9-efceb07a0918","resolution":{"observed_at":"2026-08-11T18:15:12.743621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.697396Z","title":"A B ayesian committee machine","venue":null,"work_id":"a735501c-80d6-4e1f-be71-2c7032486982","year":2000},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.131511Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:c88f7b9ce877213d66b3e8a405c2ab2f196eae2392c57835c471f4d828f8c3e9","observation_id":"b02077f1-2c83-4e16-9927-6af9930972b8","resolution":{"observed_at":"2026-08-11T18:15:12.706744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.666865Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"cb360fcb-8fab-4c74-8a6e-4514ff794e69","year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.139994Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:fad46756c2956dc21e28b66be117f57c668bc4f745046d7a5c3016178e10fc46","observation_id":"c2478687-5d2f-4d51-b170-201bdb0ea5cf","resolution":{"observed_at":"2026-08-11T18:15:12.674500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/5539970","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.498816Z","title":"Ehinger, Aude Oliva, and Antonio Torralba","venue":null,"work_id":"a07146d7-b502-4f1b-a079-a9c6e2eb9b3f","year":2010},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.146569Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:994b78996b6834fbc080b16b51802778d30d2e0867bea1681b7fbbf77a15c2c1","observation_id":"cfd7f9dc-8af2-40c3-b6f9-9428fea2ec56","resolution":{"observed_at":"2026-08-11T18:15:11.511223Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.637505Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"8716199b-28de-4379-82a9-b64bc127243d","year":2023},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.152454Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:3a39a2e8c5959774f8be4ec2c2c06945ada68562a289bf890c0b6bc0b891c0d6","observation_id":"2585dbbb-1bae-4423-9ed7-200b9bfb7d54","resolution":{"observed_at":"2026-08-11T18:15:12.645460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.606002Z","title":"Towards few-shot adaptation of foundation models via multitask finetuning","venue":null,"work_id":"0c4cb56e-6fb7-412a-a9f9-41093c70e5a5","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.158372Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:08e0d6bf3d05dbade6ebb3ea468a1ae4dba9351c1bd595814e31f29769fea144","observation_id":"97340a3b-6d14-49f4-b3a1-e7611ffe84e8","resolution":{"observed_at":"2026-08-11T18:15:12.612745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01719","last_updated":"2022-07-20T03:27:47Z","snapshot_observed_at":"2026-08-13T16:47:45.904751Z","submitted_at":"2022-02-03T17:36:07Z","title":"FORML: Learning to Reweight Data for Fairness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01719","snapshot_observed_at":"2026-08-11T18:15:11.167948Z","title":"FORML : Learning to reweight data for fairness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.167948Z"},"links":{"cited_paper":"/paper/2202.01719","citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:11c1830aaafe725e08ef377b4517a30d1e4016fa179b12f0b3f467070e92f88e","observation_id":"602dd2c2-18fe-439b-97ff-1b0e5729ae93","resolution":{"observed_at":"2026-08-11T18:15:11.167948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.572525Z","title":"Adamerging: Adaptive model merging for multi-task learning","venue":null,"work_id":"93cd0922-3dd5-46eb-8cde-449de3fb4c0e","year":2024},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.174240Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:8fef68e962fc7e8929f88cbcec15ac2c811306ef9ea3f95cae473b936b5ccfbd","observation_id":"223edb0f-e7c1-4a25-abae-67512cab4bec","resolution":{"observed_at":"2026-08-11T18:15:12.582686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:11.179853Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.179853Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:d14d4b9d72399abf3879a38727860d90b2c02d68b96f5ad2e42315e269963001","observation_id":"d3ace85e-fbb7-45a0-94b8-f3fafe13ce02","resolution":{"observed_at":"2026-08-11T18:15:11.179853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:12.542263Z","title":"Character-level Convolutional Networks for Text Classification","venue":null,"work_id":"cf4721ec-e3ff-4821-81ba-5465d984f78d","year":2015},"citing_paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:11.185463Z"},"links":{"citing_paper":"/paper/2412.08147"},"observation_digest":"sha256:a2c3d7bad4d09c6a15f76edd5a2b28d1365dc4d21cb3b46350d17c8b3feaa352","observation_id":"be6e1a6e-b594-4cd3-9ea2-f81b0733a5a0","resolution":{"observed_at":"2026-08-11T18:15:12.548796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08147","last_updated":"2026-06-23T16:19:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T18:06:56.624493Z","submitted_at":"2024-12-11T07:06:36Z","title":"Variational Model Merging for Pareto Front Estimation in Multitask Finetuning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":4,"verified_fuzzy":41},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2412.08147."}