{"as_of":"2026-08-12T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66148b22ca7f828c3ad16a75c85987665b01b6a30237b36847a59a65eac50a94","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:34:35.594979Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:41:58.673348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:35:51.417589Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"cited_work":{"arxiv_id":"2501.04568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feedback- Driven Vision-Language Alignment with Minimal Human Supervision","venue":null,"work_id":"6f295088-67b2-4f6a-a52b-80b54cb79ed8","year":2025},"citing_paper":{"arxiv_id":"2604.05614","last_updated":"2026-04-07T09:03:12Z","snapshot_observed_at":"2026-08-11T12:47:51.577381Z","submitted_at":"2026-04-07T09:03:12Z","title":"Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:41:58.673348Z"},"links":{"cited_paper":"/paper/2501.04568","citing_paper":"/paper/2604.05614"},"observation_digest":"sha256:6931ed93fe1257524575308f4124f4a46707fc6e5d7710372873a77d7e30dcd5","observation_id":"e39f026f-64ca-46ac-9e31-8b1b235e05e1","resolution":{"observed_at":"2026-05-10T22:35:51.423869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04568/citation-record","integrity":"/paper/2501.04568/integrity","json":"/paper/2501.04568/citation-record.json","paper":"/paper/2501.04568"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T21:34:34.931476Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.931476Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8cad055b484ff17f03c51b4fbe566c9ac5014500c660625bce510e94841c29b8","observation_id":"878090a4-d779-44d2-b6f8-1d0a6d23754b","resolution":{"observed_at":"2026-08-10T21:34:34.931476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.937048Z","title":"Agrawal, K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.937048Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a7b8a495491c1f671e4fdfdd6116449403da8f1570b47366bbd65a6cba207421","observation_id":"32d9879f-8e91-4db7-90ee-899051b96cc1","resolution":{"observed_at":"2026-08-10T21:34:34.937048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-10T21:34:34.941481Z","title":"Ahmadian, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.941481Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:61b322a57ed0508a8d0476e854dfbfe55b59f7dc34668c70c46b74130c8ba639","observation_id":"3694a681-b2d0-4114-8ced-70895428e77c","resolution":{"observed_at":"2026-08-10T21:34:34.941481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15661","last_updated":"2023-05-17T21:08:32Z","snapshot_observed_at":"2026-08-07T19:33:04.292595Z","submitted_at":"2022-11-28T18:59:51Z","title":"What learning algorithm is in-context learning? Investigations with linear models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15661","snapshot_observed_at":"2026-08-10T21:34:34.947407Z","title":"Akyürek, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.947407Z"},"links":{"cited_paper":"/paper/2211.15661","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:9d8c3bc3ba5f64507246539f7ddf46fd186f03292a98b425bd87bf5f0022d280","observation_id":"4ffd809b-61fd-4843-96ab-870d088a292e","resolution":{"observed_at":"2026-08-10T21:34:34.947407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.953338Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.953338Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:5b214930a6c0a8c76468aefe55705dfd63fd1574307ab7508f0fed4bf137f212","observation_id":"7474ee78-909d-4701-9a8f-384dc7bab561","resolution":{"observed_at":"2026-08-10T21:34:34.953338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.958760Z","title":"Anthony, Z","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.958760Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6948aa1782a92f1418d6921eb052edd8109dca75fc33f3cb02a78a155774fe54","observation_id":"71d04822-d2d4-4bc0-9c9a-8ad64dc95e1a","resolution":{"observed_at":"2026-08-10T21:34:34.958760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-10T21:34:34.964208Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.964208Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:feb1d8892284d0d51b188304fee1a29932e56369ce90d994bda0e9ef740e860c","observation_id":"cdab2c24-dd18-40d9-89c0-c0f18369e1fe","resolution":{"observed_at":"2026-08-10T21:34:34.964208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-10T21:34:34.973845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.973845Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:68e0940253dd710991b0e859d3316488e93c577672eb3c44314ed927e5e2ae1c","observation_id":"e6885b9d-e499-418e-8676-15396940c355","resolution":{"observed_at":"2026-08-10T21:34:34.973845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.978603Z","title":"Banerjee and A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.978603Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:145f7e9e2cf6944da768b5c6def201be03daf8b2438036c82bba509072ba6982","observation_id":"eb961fdf-bffd-453e-9911-eaa1254e266c","resolution":{"observed_at":"2026-08-10T21:34:34.978603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.982785Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.982785Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8fc35f4e9ea9a796004800717cbb7babfe95ccf43e356d311e27c51a5e3f5f35","observation_id":"34624016-5e5f-4eb1-980f-e0ba1c339fe0","resolution":{"observed_at":"2026-08-10T21:34:34.982785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T21:34:34.987003Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.987003Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:06b9b83272ba7e2e0fdb84322d11d14b84663824188a04089891cc899d976444","observation_id":"a2d0aaeb-d4cd-4ca1-8fbe-5d464f3bd4b3","resolution":{"observed_at":"2026-08-10T21:34:34.987003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-11T09:47:06.410749Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-10T21:34:34.991443Z","title":"Bordes, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.991443Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b495bb4ec86d472befeadc2293b1818e4385e5c47a5dc6223879baa3c68e70c1","observation_id":"9d087100-76dd-4a0e-950f-c2b6f169a9fd","resolution":{"observed_at":"2026-08-10T21:34:34.991443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:34.995902Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:34.995902Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:244cba8534866a418d5e4d61ea83a232486d1da7b797a1e5fd6e8b1994794a7a","observation_id":"c495a7b7-1008-4907-8641-d6b95aabe1bc","resolution":{"observed_at":"2026-08-10T21:34:34.995902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.000515Z","title":"Carion, F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.000515Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:5e960ec3b6d66ae73d4c4e953c39806883c8f7e6f2841ba61ff5fbb2403fee7f","observation_id":"5bf2d01e-dbba-43ac-9d0e-333859fa2f8a","resolution":{"observed_at":"2026-08-10T21:34:35.000515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-10T21:34:35.004387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.004387Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:131067d412e747b7a5afb51b87de47f9cb4a38a86e9f872957a4ef5c6c54c342","observation_id":"b5c61565-a26f-4a92-9daf-179399d0330c","resolution":{"observed_at":"2026-08-10T21:34:35.004387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.008817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.008817Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:0806193379752dc6547c349864e1053b21cc75beeec54415cce707b1883e19e4","observation_id":"89342bce-3e91-4aac-bf88-d82c344e4c1a","resolution":{"observed_at":"2026-08-10T21:34:35.008817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.013082Z","title":"Chiang, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.013082Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:892f94f82d2bdbcb4a0e680eed8c46083a8b9b1a17bc87322a6f468ed096f61e","observation_id":"850fcc1d-5643-4686-9f1d-0fddf665bf05","resolution":{"observed_at":"2026-08-10T21:34:35.013082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.017220Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.017220Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8efe930e024b4e439724551687cb1b35ea2ac89dd66b8777ce8c3b514c4d4149","observation_id":"2046ea3d-8e12-45da-97ec-a0f27ca6eb92","resolution":{"observed_at":"2026-08-10T21:34:35.017220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.021685Z","title":"Collerton, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.021685Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7794b292f2709c2842e7fae4db88c28024d2e9400b3c828530aae29ab221b346","observation_id":"fc4d0547-f5f6-462a-a702-3fa95d0eca58","resolution":{"observed_at":"2026-08-10T21:34:35.021685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.025848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.025848Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6e92f38acdf9de15ecd364d10ada47737b4a7d52c65d94666611c3d87335d90d","observation_id":"56f71cab-a7d4-463f-8650-3f89730ac78a","resolution":{"observed_at":"2026-08-10T21:34:35.025848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01066","last_updated":"2022-03-15T06:04:05Z","snapshot_observed_at":"2026-08-10T23:04:40.688955Z","submitted_at":"2021-02-01T18:56:02Z","title":"Evaluating Large-Vocabulary Object Detectors: The Devil is in the Details","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01066","snapshot_observed_at":"2026-08-10T21:34:35.030102Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.030102Z"},"links":{"cited_paper":"/paper/2102.01066","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:34805c4d5d6a90ddf05e9e3858143f2392bea69acab89fd23ad5cf24c676f43a","observation_id":"9adc9177-a2b2-424f-8f65-f755a66aa877","resolution":{"observed_at":"2026-08-10T21:34:35.030102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-10T21:34:35.034916Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.034916Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c4ebe0ec0016e4be6b17e2c3751f2e7598e1aeca1169e7eefcce227f5197b0fb","observation_id":"a2f69265-b911-483d-a4de-259bd3085b10","resolution":{"observed_at":"2026-08-10T21:34:35.034916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T21:34:35.039873Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.039873Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:54f835e827db8930b5f9da81ce6a3b53a41d08c390a81027b993ddea9f53c566","observation_id":"db55ea79-7b36-47a2-b88d-100efad54b0a","resolution":{"observed_at":"2026-08-10T21:34:35.039873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.044221Z","title":"Favero, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.044221Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d37c3bce6f64ff5e783df4f3fc43caf0f5df0443c6c230001c579e2e9c25ea1a","observation_id":"a2c326b4-a744-4bb0-bdc7-95995fa1fafa","resolution":{"observed_at":"2026-08-10T21:34:35.044221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.048986Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.048986Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:54b11a1236f0464bc7aeb042d1199dfb206bc94c34290bce7036de0bafdf1095","observation_id":"5052f0c0-c76e-46bb-bea3-dac339e76a4f","resolution":{"observed_at":"2026-08-10T21:34:35.048986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.053903Z","title":"Girshick, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.053903Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d20185819517dd2fd2e0b09d1112842629194ab91099ab2afc227590649647d6","observation_id":"5cae555b-9c03-4fa3-ae0f-af6141fd5145","resolution":{"observed_at":"2026-08-10T21:34:35.053903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.058226Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.058226Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:15f9eb358b058b311a04da06d6c8aa3f8a0d8e63cf5c6146ca981665c140c7e0","observation_id":"b32a54f5-af38-41f5-a890-2daa442ea00c","resolution":{"observed_at":"2026-08-10T21:34:35.058226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08215","last_updated":"2023-06-06T13:09:21Z","snapshot_observed_at":"2026-07-06T14:52:30.853139Z","submitted_at":"2023-02-16T10:59:39Z","title":"Aligning Language Models with Preferences through f-divergence Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08215","snapshot_observed_at":"2026-08-10T21:34:35.062540Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.062540Z"},"links":{"cited_paper":"/paper/2302.08215","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c6295fcf74939447273e2a7c931b712c2d657b325fc742bf89e1c9845296d190","observation_id":"698ca582-b5e9-483e-950e-fd79b10bf7c0","resolution":{"observed_at":"2026-08-10T21:34:35.062540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-10T21:34:35.067108Z","title":"Gulcehre, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.067108Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:60e0369574a2d6db73d172eda27521f948d49060966b35a20deaf73fc8c67c93","observation_id":"f577cb62-6a42-4cc3-a61f-f0f2f6702c37","resolution":{"observed_at":"2026-08-10T21:34:35.067108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.071728Z","title":"Gupta, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.071728Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:0b3b93380377365fcf64089098c79518d239b4dde0ae86cbf23bb777f9013c08","observation_id":"68106966-7b72-4cba-a9b4-f035876b65f1","resolution":{"observed_at":"2026-08-10T21:34:35.071728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.075865Z","title":"Hattie and H","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.075865Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:490a60e760a5761534129230f478afc567903bd50ad5fa5f2aa5d1a805ae6046","observation_id":"2eca5a40-89a6-41a3-854f-d06155598b7b","resolution":{"observed_at":"2026-08-10T21:34:35.075865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03264","last_updated":"2024-04-04T07:39:55Z","snapshot_observed_at":"2026-08-07T23:02:29.042190Z","submitted_at":"2024-04-04T07:39:55Z","title":"Foundation Model for Advancing Healthcare: Challenges, Opportunities, and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03264","snapshot_observed_at":"2026-08-10T21:34:35.080759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.080759Z"},"links":{"cited_paper":"/paper/2404.03264","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:78f95ea0a5c141466e4856ee502ed5cffed5d438622ba52fdd74d4ba2dcfeb92","observation_id":"1e843c24-4400-42a9-8c2d-29f2ad650c82","resolution":{"observed_at":"2026-08-10T21:34:35.080759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.085552Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.085552Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f7c41cc543405ca043f091c715931eaee3e078b32161d99448df301d409aed65","observation_id":"3b03dd56-acf9-45ee-a62e-ba5f1eb5c64b","resolution":{"observed_at":"2026-08-10T21:34:35.085552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05439","last_updated":"2020-11-07T20:22:57Z","snapshot_observed_at":"2026-08-07T17:16:52.918771Z","submitted_at":"2020-04-11T16:34:24Z","title":"Meta-Learning in Neural Networks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05439","snapshot_observed_at":"2026-08-10T21:34:35.090793Z","title":"Hospedales, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.090793Z"},"links":{"cited_paper":"/paper/2004.05439","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:5f1149e415ad3d988c1ccbade80375b3d8e450f2eece00b95722a5282c7baca5","observation_id":"b6fd9dc4-654f-4009-9412-cb8348171412","resolution":{"observed_at":"2026-08-10T21:34:35.090793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T21:34:35.095790Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.095790Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:07c63e7aaea7bdec79082aed3b22a6e32ce3375e313af252ea65e93a3e97c0c7","observation_id":"8cb71eeb-2f44-4129-8371-3e4fec8a6962","resolution":{"observed_at":"2026-08-10T21:34:35.095790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.100708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.100708Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b3659749cda8a5cb632ee364eeed429aad7b75cb0b3ef283529fca7854413532","observation_id":"86a9a661-7f35-4a24-97f5-3305cf2a3f51","resolution":{"observed_at":"2026-08-10T21:34:35.100708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T21:34:35.104820Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.104820Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:fade6971348435de8a26c3713fc5be211ecb6ae0c0bb88750d54ed50aee0b917","observation_id":"23b50291-d88b-466a-8124-7a0bce5b3ec8","resolution":{"observed_at":"2026-08-10T21:34:35.104820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.109247Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.109247Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6ce63b7afea252981b27ceab462c857b58e828ab1b8f598dd24213b132e22851","observation_id":"037b3905-0924-4610-a01c-dcac07746564","resolution":{"observed_at":"2026-08-10T21:34:35.109247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12034","last_updated":"2024-10-07T14:27:56Z","snapshot_observed_at":"2026-08-07T00:14:51.663263Z","submitted_at":"2024-06-17T19:06:54Z","title":"Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12034","snapshot_observed_at":"2026-08-10T21:34:35.113712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.113712Z"},"links":{"cited_paper":"/paper/2406.12034","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:402bdc3b82051a8b47e4cb182d590a177e64715bfbd1114efe15bbdc8b9ed8be","observation_id":"610cf59a-1b5b-4248-8419-0feacd8cdb6a","resolution":{"observed_at":"2026-08-10T21:34:35.113712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.118025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.118025Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ed3aacb9270a21c7dab091b4ce01caeec3b0287f888d34b85d28ff4dcdb1e7b6","observation_id":"2f54bac0-1e87-4bd7-88f0-3e37e75f886f","resolution":{"observed_at":"2026-08-10T21:34:35.118025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.122652Z","title":"Kazemzadeh, V","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.122652Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:95ef4556c415b649b4301939fd95555c0ba070749dd20ae15424f07f4fc756aa","observation_id":"9eb64d4d-e5bd-4d12-8e1d-ca38b30f3a2e","resolution":{"observed_at":"2026-08-10T21:34:35.122652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.126990Z","title":"Kiefer and L","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.126990Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:3fd50f0537afee6b7d7ea05fe80ae1687e78ed1de5f36b92949606332c516396","observation_id":"3b02740c-0921-4a76-9d19-b0fcbcad3f8d","resolution":{"observed_at":"2026-08-10T21:34:35.126990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.131178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.131178Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e581f8ec2e13bba2ce9d202f7e314355c85831104cbf41a887f80c5352933276","observation_id":"d327302b-3b75-4d4d-8caa-a6c84789e86c","resolution":{"observed_at":"2026-08-10T21:34:35.131178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.135371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.135371Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:87b98727b02a2ec2e4d44abba1bf780889b57a06f3ceed12baebfb30723f9dd6","observation_id":"1b8325a1-a876-4e4a-96ef-2575662909ff","resolution":{"observed_at":"2026-08-10T21:34:35.135371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:34:35.139694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.139694Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:84209766352a7077ce98988cc52b732d587915c514780852def307144d918d55","observation_id":"ee277cb2-d287-40fa-b6ce-2d5dba39fffc","resolution":{"observed_at":"2026-08-10T21:34:35.139694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.144811Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.144811Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c282d4d7542c746dc321fe3f77ec1884aee4b7973b7d58ce874a0b67ad72da25","observation_id":"cb2fafe6-72c7-4b7b-8f58-a838f84a00eb","resolution":{"observed_at":"2026-08-10T21:34:35.144811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.149220Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.149220Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:3f4ad9cbdc65fd01f36b560908943b196b8a6e04cd973df4c1b4cc0ef00594e0","observation_id":"bc133f54-8fdc-4192-8e62-de5ed743dd83","resolution":{"observed_at":"2026-08-10T21:34:35.149220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.153357Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.153357Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:2e2e7bf46ce379da0e3a42b6b9c06c5ea7fe96dc34c23e95e498de7d494912c1","observation_id":"5631aa0a-b0c0-4041-b00e-ce2faefa1066","resolution":{"observed_at":"2026-08-10T21:34:35.153357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T21:34:35.159313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.159313Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:99c1c35a19ccd55ff284ed166952809ad2ef8a96857cbf00e1b91a17ffd916a0","observation_id":"78737c36-eb42-4e24-9a99-722fe21f42f0","resolution":{"observed_at":"2026-08-10T21:34:35.159313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.09835","last_updated":"2017-09-28T15:59:41Z","snapshot_observed_at":"2026-07-06T05:53:24.061473Z","submitted_at":"2017-07-31T13:08:11Z","title":"Meta-SGD: Learning to Learn Quickly for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.09835","snapshot_observed_at":"2026-08-10T21:34:35.164496Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.164496Z"},"links":{"cited_paper":"/paper/1707.09835","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:de8440934ea2df27e837dde4a0c647e9d2cddaa5f41e614086d0f5f4cbcc6cbd","observation_id":"5ba40cf8-7280-4d1b-a358-e40855b3a362","resolution":{"observed_at":"2026-08-10T21:34:35.164496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.169519Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.169519Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a3926d43147b55543cda549de5b5a47614ebd7f2dfb1114baf64ffb7ae64d86f","observation_id":"867056cb-d36c-432d-a46a-5e5117686c13","resolution":{"observed_at":"2026-08-10T21:34:35.169519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.174740Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.174740Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b2d95df7787316c71e2a3812bbe09e20cbae0fc2b77070dab695527776be0bdc","observation_id":"39b8c9e1-c9b8-4868-a147-d4d1fd770d66","resolution":{"observed_at":"2026-08-10T21:34:35.174740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.178963Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.178963Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b50ccb6775a9451d3612d7d6e5d646a1d9f980415d30f2257e7db1cf97fe515f","observation_id":"17b11415-edfa-4406-9077-25d3f6030d6a","resolution":{"observed_at":"2026-08-10T21:34:35.178963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.183587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.183587Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:14c230e8d4cad08a1abf95ddc415c73f6115710a2e29fb5e0b8c3e35abbcf421","observation_id":"0c16ae80-772e-4bc9-ac9e-e8efef9a8723","resolution":{"observed_at":"2026-08-10T21:34:35.183587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.189707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.189707Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:cdd3a3815f8227760b90705b240b61186425bb4d177bfea78c525ed443db8cab","observation_id":"b45e967d-0689-43c1-951d-b377fa5b91ba","resolution":{"observed_at":"2026-08-10T21:34:35.189707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.195100Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.195100Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ca124b25bfc6c5436af389189f267d4b6f59d985dc95f3a6eb8178a5286fd545","observation_id":"ea07be76-999d-477b-8c8a-fc21358cd12d","resolution":{"observed_at":"2026-08-10T21:34:35.195100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-10T21:34:35.372992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.372992Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:45ddfe56e2fe18f578bf8050340c7883897226bc777d957870f278e4183da43b","observation_id":"61207065-261c-4e15-85d2-d48cc2b14958","resolution":{"observed_at":"2026-08-10T21:34:35.372992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.378684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.378684Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:9542bd8b95e384d7d9ca1fda3ef1026c2ad51444352bb24db09091c162bed925","observation_id":"845a080a-1088-4a7c-b38e-b51a555704dc","resolution":{"observed_at":"2026-08-10T21:34:35.378684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.383422Z","title":"Madaan, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.383422Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:fac236a5d367b621e4f51d72ece64ffa15e48f63c76696032a072aec16bfbe7f","observation_id":"91a31114-c52b-481b-9360-3f8f2a83cffa","resolution":{"observed_at":"2026-08-10T21:34:35.383422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.388417Z","title":"Oquab, L","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.388417Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7c4e34db13d930d9c104328bf0cbde7208759a9c9de84f36d3f8504fb0969ac8","observation_id":"d3da44bd-ce66-4737-8f13-cb77737f3385","resolution":{"observed_at":"2026-08-10T21:34:35.388417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T21:34:35.393161Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.393161Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:a5a5b2ee46229553740b42317681dd70a11152dcd4bec1006842500e4ecbf2c6","observation_id":"83b172f2-c784-43df-af09-ab8179ac6f8e","resolution":{"observed_at":"2026-08-10T21:34:35.393161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.398610Z","title":"Papineni, S","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.398610Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7bb2bbe334293aed1a78484a2f3635e6f09b7f5158b3bc2db8c8f1955a946a7a","observation_id":"f129c070-7340-42e9-9204-5b344f73b326","resolution":{"observed_at":"2026-08-10T21:34:35.398610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:37.021103Z","title":null,"venue":null,"work_id":"766776e4-293f-4d29-93e4-37941f3ccf5a","year":2015},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.404501Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ad24083278bf5c5cf705e5b67b0691e02b4e2adbd0f4bf089f61d1ecec3dbd2f","observation_id":"46d47fc1-be05-47af-b5c2-de0f89acb80e","resolution":{"observed_at":"2026-08-10T21:34:37.027583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-10T21:34:35.410160Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.410160Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:9a5a8e1734ee0710a7163299632f88491d724a435bcc583c3340c5a9236d9db7","observation_id":"61e5d573-b8a4-4fba-b07a-c8bb7e0464d1","resolution":{"observed_at":"2026-08-10T21:34:35.410160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:37.003019Z","title":null,"venue":null,"work_id":"ae83c669-3d2b-4112-950a-856893208770","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.417009Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e03c98310f9419f86a8c9d5566c99a4367ced142c72da6d6584bf95e903c9137","observation_id":"57d8e92c-08d4-493a-aade-2acd2b7ec86e","resolution":{"observed_at":"2026-08-10T21:34:37.008257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.421983Z","title":"Peters and S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.421983Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:83d1d5b9498a565c8738942061560ff66d8a56f11987d6d94886f4981a477127","observation_id":"0f4293f2-33f2-494f-9a2c-110b6374ac53","resolution":{"observed_at":"2026-08-10T21:34:35.421983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12668","last_updated":"2024-12-09T18:54:36Z","snapshot_observed_at":"2026-08-10T17:24:03.948023Z","submitted_at":"2023-11-21T15:20:48Z","title":"From Concept to Manufacturing: Evaluating Vision-Language Models for Engineering Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12668","snapshot_observed_at":"2026-08-10T21:34:35.427447Z","title":"Picard, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.427447Z"},"links":{"cited_paper":"/paper/2311.12668","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6dd3e5297671002e89211145f7b8db59295375f8a149b2d8b4e97c485c8b29dc","observation_id":"f11008db-3ecd-42dc-b569-bac88f915e96","resolution":{"observed_at":"2026-08-10T21:34:35.427447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.435022Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.435022Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:1bc6e08b2277930742f0088f40faf344ae965859ad3325cc0f88dc621f014807","observation_id":"9fe61691-2c1a-4d29-99a5-9929d98c2684","resolution":{"observed_at":"2026-08-10T21:34:35.435022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.440302Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.440302Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6e6a7536670abaf979c969f0005131788950e9cda554508e531ab1fed49a77ae","observation_id":"a41a9d37-9ca0-461b-9249-475131ffde94","resolution":{"observed_at":"2026-08-10T21:34:35.440302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.952100Z","title":"Rafailov, A","venue":null,"work_id":"77316bc5-7e25-41b6-a7ed-03d194acb489","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.445372Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c1301d567687e4e0b0df67257ec5c58d1c971d23ddb44af6a5c1c4015e6be71c","observation_id":"be003b50-e0a8-4d17-8689-fcba51ad3b71","resolution":{"observed_at":"2026-08-10T21:34:36.956900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-10T19:28:02.997514Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-10T21:34:35.450573Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.450573Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:06d8664811de8183a2083470a66276f776f006d24ac0ae9c7119c519c9b3157e","observation_id":"1ab5e6f0-e331-4e55-beb0-0b0d50c531e6","resolution":{"observed_at":"2026-08-10T21:34:35.450573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.935791Z","title":null,"venue":null,"work_id":"6f59a38a-6d9a-4c6c-8b09-912e888636b2","year":2016},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.455262Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:97a7c0c0be77a3290c1ac5977562ac466be67f1afa9628877184ad0f799465c8","observation_id":"126f1b1d-4ab7-4e86-8581-e6c2e14c3c57","resolution":{"observed_at":"2026-08-10T21:34:36.940756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-07T16:54:46.428327Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-10T21:34:35.460399Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.460399Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:71bce945bf7bddf60771e92974989e837053b7ca4672b0a25d588556471e0a3f","observation_id":"e5621796-6727-4ed6-b694-2dfa5474df98","resolution":{"observed_at":"2026-08-10T21:34:35.460399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.919265Z","title":"Saikh, T","venue":null,"work_id":"37118b2b-59e9-4ab6-a3d9-50d7ebd08002","year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.465293Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:bfec4e42df3e7132004c59247f8faa6e855e7fa909926051771ea49cbebd0563","observation_id":"10f49899-a4d2-4c1b-a778-eec86572a4d2","resolution":{"observed_at":"2026-08-10T21:34:36.925038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13146","last_updated":"2025-03-30T01:59:15Z","snapshot_observed_at":"2026-07-06T19:34:59.826604Z","submitted_at":"2024-10-17T02:03:27Z","title":"debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias","version":2},"cited_work":{"arxiv_id":"2410.13146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13146","snapshot_observed_at":"2026-08-10T21:34:36.155671Z","title":"debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias","venue":"cs.CL","work_id":"3d5aa939-807a-4bad-87b8-1b3f67816282","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.469776Z"},"links":{"cited_paper":"/paper/2410.13146","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e7006f59304374359444f12c1c77044839b53456292ceb341c31e50d0ef770ec","observation_id":"c953b626-e876-4aa4-940e-8fb7a6d1ba7a","resolution":{"observed_at":"2026-08-10T21:34:36.163169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.901105Z","title":"Schaul and J","venue":null,"work_id":"12a1e7ca-7f8d-4569-9fc1-525afe6f9492","year":2010},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.475072Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:0e8d720ed2b5f30126413dc73fcb4e7c7f8197858c1e1319d41214557162f0f4","observation_id":"28e199e8-3641-487a-a636-1492a94fbc00","resolution":{"observed_at":"2026-08-10T21:34:36.907427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.885133Z","title":"Schmidhuber","venue":null,"work_id":"de296ecd-9e8f-45fc-92fb-268585c16550","year":1987},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.479819Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:97160cd7ef5fa47b66a21910121ab4448906a14c9385e5f1dc0e838582e4120c","observation_id":"2ae740d4-afdc-4fcc-b674-b3b7deaec2e7","resolution":{"observed_at":"2026-08-10T21:34:36.889969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.871263Z","title":"Schmidhuber","venue":null,"work_id":"6d135317-0e3d-4352-b679-9d8198df0580","year":1999},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.485458Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:26627c579a742ebcf8c9279f427e36e425675a716c3c1b5b6a0cd93c4b8ec0da","observation_id":"e215bbec-0b46-4a8b-8181-8509df3e1371","resolution":{"observed_at":"2026-08-10T21:34:36.875814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.490872Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.490872Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:42ff3182524c3b07342ca3b95a87daefb41e562ec44673193b0d273879283849","observation_id":"fcabd321-b44f-4286-88ca-3da27a5b362f","resolution":{"observed_at":"2026-08-10T21:34:35.490872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.842673Z","title":"Shinn, F","venue":null,"work_id":"5b7e6b42-6ad1-4803-a28f-6ce4c79d8cb1","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.497061Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7386eea67f87c1e60c852f8af2e1af32d99d0c08d170faefaa1b15ca446736e1","observation_id":"46d187af-f7c2-4f15-ab81-a909bd26285e","resolution":{"observed_at":"2026-08-10T21:34:36.847748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.819049Z","title":"Silver, A","venue":null,"work_id":"4ebc6c72-f103-4b5b-a90d-a7a723904030","year":2016},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.501869Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:8c983dc66043fbceb9615c7c2a49ea70fbfffdc6909cad8b84541805d2ee61b2","observation_id":"2e1b7217-daaf-4198-8a5a-83d67092de2e","resolution":{"observed_at":"2026-08-10T21:34:36.826926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.506314Z","title":"Silver, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.506314Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:61ba8a909981766ebb857d25198e7a0a7554b8d58f10dd02d1a2b67f957f84c7","observation_id":"30721518-8d62-404a-a00c-90492671ca67","resolution":{"observed_at":"2026-08-10T21:34:35.506314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.789993Z","title":null,"venue":null,"work_id":"70cfdf3d-2a54-4c15-bf6c-33b5064a6cec","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.514137Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:4c131351ac917da186d2d9b4ab691ee5a2afdb9311c826e85469bcd6847834fb","observation_id":"622fd121-1d72-4c7a-8940-df7fe757edb6","resolution":{"observed_at":"2026-08-10T21:34:36.794520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01081","last_updated":"2024-04-29T18:55:34Z","snapshot_observed_at":"2026-07-06T17:38:30.401240Z","submitted_at":"2024-03-02T03:48:37Z","title":"LAB: Large-Scale Alignment for ChatBots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01081","snapshot_observed_at":"2026-08-10T21:34:35.518320Z","title":"Sudalairaj, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.518320Z"},"links":{"cited_paper":"/paper/2403.01081","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:71316a9fa156545f3eabc6a4a42fc7ba758b634fe0285762a1ea41dc30b08859","observation_id":"de6afcbe-64cb-4519-85b2-2a193a16f7bf","resolution":{"observed_at":"2026-08-10T21:34:35.518320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-10T21:34:35.523168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.523168Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f700d4e902d570636ff01b932bd1c4bd84552f41aea06cb962ecf5474050e9a2","observation_id":"5aa47013-f822-4ba3-bd82-29e57d74f91e","resolution":{"observed_at":"2026-08-10T21:34:35.523168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.774152Z","title":null,"venue":null,"work_id":"1af30ca5-0864-4f4b-9c83-70cf99b8ecf3","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.528275Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:136c67ed6ce4d2761d2267d90ac5d1cf91d9bff45e0904cda593683c1d550a28","observation_id":"b88f8223-f487-4038-8072-35647fa28bd9","resolution":{"observed_at":"2026-08-10T21:34:36.778848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.760148Z","title":"Tenenbaum and E","venue":null,"work_id":"64b1f055-c094-4f40-a27c-7aac5a6bb52e","year":1989},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.532809Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:edb39b31e0556d50a1b2218ded4416a245ffcfcab01a2e33fa59be643fe29af9","observation_id":"38292c0a-2459-4ddd-80c4-20e34317a08d","resolution":{"observed_at":"2026-08-10T21:34:36.764526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.538223Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.538223Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:f53fc2a0854aa04787dbba5a443853e21e075cd0ed1058106050d4f7c7a61e5f","observation_id":"49f63fe2-1ca2-4fc9-8902-aafa98facb7d","resolution":{"observed_at":"2026-08-10T21:34:35.538223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T21:34:35.543022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.543022Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:6077e09aa892b8babceb81461407a086d95fa47fb42d5f5260d9b4a66ad595d7","observation_id":"07da72ab-9485-4eff-b109-686cc87aff44","resolution":{"observed_at":"2026-08-10T21:34:35.543022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T21:34:35.547860Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.547860Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:c06f834136a9b7ea3ec55e6317f9b097153f9aa4f96471d7a3ed81fbc3a86de3","observation_id":"84fd5bb2-6076-4f32-ba69-019c6427ff41","resolution":{"observed_at":"2026-08-10T21:34:35.547860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.737537Z","title":null,"venue":null,"work_id":"bf49e533-8fde-431f-b383-835841c80f79","year":2007},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.552315Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:227393c3f30807a4a6de8ee76cc2ecfe031b009371a015c8912998de635d51ec","observation_id":"9c8b10f1-ac13-4b87-921f-85d627c45a9b","resolution":{"observed_at":"2026-08-10T21:34:36.742039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:35.556464Z","title":"Vedantam, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.556464Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:3f61a0cceb338772989b3fa566ea4a2ed0746d72c1075d3b9ceb5f2666badb65","observation_id":"df5ac0f1-faca-4b31-aae2-791b4ddaeca2","resolution":{"observed_at":"2026-08-10T21:34:35.556464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02325","last_updated":"2024-03-04T18:55:30Z","snapshot_observed_at":"2026-08-07T05:55:26.971464Z","submitted_at":"2024-03-04T18:55:30Z","title":"Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02325","snapshot_observed_at":"2026-08-10T21:34:35.560452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.560452Z"},"links":{"cited_paper":"/paper/2403.02325","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:82e8da90ef868880eb404608c602d5061ff43d34cf7ed05d5527ba5f6e05dba4","observation_id":"ca17a4fe-520b-41ec-9472-18fda0b16f5b","resolution":{"observed_at":"2026-08-10T21:34:35.560452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-07-06T18:19:38.561528Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-10T21:34:35.564572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.564572Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ea3e09a412799f3d2b46c2ebe10cee96b65cb0d505b5227bebb9c48082641244","observation_id":"407d1acc-13bc-4ac8-89f7-d4b7fceafdf1","resolution":{"observed_at":"2026-08-10T21:34:35.564572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-10T21:34:35.569125Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.569125Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:d7499e3f5f94bf8b2846ad3194756b5ff5a1b3614a004f1465907ab62325a584","observation_id":"8066381b-7bc6-4b24-8c16-dff82742db3d","resolution":{"observed_at":"2026-08-10T21:34:35.569125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-10T21:34:35.573795Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.573795Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ad49cac140756cba64ecd5825abbc290450114de27dd0409cd8a9aa6c7ebbf82","observation_id":"fb3bd056-b885-4e09-8458-b7ca1a314824","resolution":{"observed_at":"2026-08-10T21:34:35.573795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-08-10T21:34:35.579540Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.579540Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:ede42fe6faf369c848a231c055cdcc6ec12c3903b463b77fd4537c5498e53759","observation_id":"eb07f118-bb7e-425d-9a30-e11a15fd5a70","resolution":{"observed_at":"2026-08-10T21:34:35.579540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:34:36.714664Z","title":null,"venue":null,"work_id":"ae4ee900-236f-4bf4-9a95-fa5ee9bcc6e8","year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.584821Z"},"links":{"citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:7bef7f7728012d9b51bb5540ab02c2d0d576d4030bea0c8a13d76f25badfe149","observation_id":"8d81d9d4-a9d7-4acd-8e69-4539c64f4c12","resolution":{"observed_at":"2026-08-10T21:34:36.719148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T21:34:35.589733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.589733Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:68bf0aa4ceb6032e06249efce038db8c3b55dc786f0683301e240c6190372b02","observation_id":"f3ccbcf4-4a0d-4a35-bdf9-792dde0fd88b","resolution":{"observed_at":"2026-08-10T21:34:35.589733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-10T21:34:35.594979Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.594979Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:b4196ea642ca948195680724f9ef33f54971b91b88ec77243bef38d07fcba24f","observation_id":"77549c59-4f78-4c74-b2bc-8523a32e7d24","resolution":{"observed_at":"2026-08-10T21:34:35.594979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:50:18.803903Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 1 inbound Pith citation observation for arXiv:2501.04568."}