{"as_of":"2026-08-08T15:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b2037ec39589b5c493eb78d900b44b1a4cbb7ae1e2477b19bc2e17d1e8cbf57","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:16:23.050134Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.14024/citation-record","integrity":"/paper/2507.14024/integrity","json":"/paper/2507.14024/citation-record.json","paper":"/paper/2507.14024"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.522377Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"8e664529-215c-410f-9379-11d83b74ad75","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.700109Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:fe84e672e8c9c97ce2077845ced7504b91fc4a699823a27c6fb39f7423095d6c","observation_id":"821cc9f0-5071-4f96-8c2b-52fec93721f6","resolution":{"observed_at":"2026-08-06T16:16:23.525154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.514906Z","title":null,"venue":null,"work_id":"0ea77420-ea47-44ea-86a1-393c5ba53839","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.823657Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3486262c1d8bc99ec9a269dc48da688cad7481172cd3b340c66578658c2482d3","observation_id":"f929e428-5e38-4144-9764-0eba9ece6d68","resolution":{"observed_at":"2026-08-06T16:16:23.517224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.507218Z","title":"Instructdiffusion: A generalist mod- eling interface for vision tasks","venue":null,"work_id":"0a0a8ef4-6432-4988-b958-bba0ed14437a","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.893932Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:c727997dbb575b6b84718c7b2be03c0d5735a5812708c1b32bd17df171e17d9a","observation_id":"b52660cc-eedd-4bad-bb16-5c83c1c235a9","resolution":{"observed_at":"2026-08-06T16:16:23.509918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T16:16:22.897633Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.897633Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:64b0493b32dfa73aa1c220635843a4323c1d77d4a9c2029c83d6eb723be40761","observation_id":"042033a9-05c0-4e89-9016-7eef99e45cf9","resolution":{"observed_at":"2026-08-06T16:16:22.897633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.499213Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"19be1d4b-41af-40be-a5cd-aa5f99f2b896","year":2014},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.900707Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:46a00487f8baa81dfc2ad1568d05018f635afb8349e95760777b114cc49e20c1","observation_id":"524f47fe-a751-474a-a0aa-288bf8f9b749","resolution":{"observed_at":"2026-08-06T16:16:23.502254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.490950Z","title":"Universals and cultural differences in the judgments of facial expressions of emotion","venue":null,"work_id":"db446710-b5fb-4bb4-9332-d64e5c01548c","year":1987},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.904130Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:a472724227e983995bdc1b30d6a15cc7756383fb382df8cfe0bab05fd21de300","observation_id":"b521dfd6-01cd-4368-b52b-70df2d232d13","resolution":{"observed_at":"2026-08-06T16:16:23.494205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.482770Z","title":"Affective image classi- fication using features inspired by psychology and art theory","venue":null,"work_id":"f46ba928-43f6-4be8-9f93-01622ce0cc96","year":2010},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.907586Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:daf62aa149121f47ab1e21198c279161338c5369ff2015cc02cfb6f4f7387531","observation_id":"4656edef-6dca-46c2-bf62-0c29056f0ddd","resolution":{"observed_at":"2026-08-06T16:16:23.485713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.475150Z","title":"A mixed bag of emotions: Model, pre- dict, and transfer emotion distributions","venue":null,"work_id":"6e6b2c38-bfdc-4c08-b843-6cf89d0f9077","year":2015},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.910142Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f2a0455a99d3a46d5cc99f5f18b09dc27d2a76218a6f613b1030045eea27061b","observation_id":"feab293a-124a-45e6-8b97-1b440516731b","resolution":{"observed_at":"2026-08-06T16:16:23.477826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.467355Z","title":"Emoset: A large-scale visual emotion dataset with rich attributes","venue":null,"work_id":"83050101-b9e9-4aa8-942d-0b0a476b74ae","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.912712Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:51c22a6e98161742cd3c042cd33e2d9342e6613ba95c8ab690ae3c621b24dfbf","observation_id":"41bc7bd8-c63c-43f2-986f-2d5dbe2ebe29","resolution":{"observed_at":"2026-08-06T16:16:23.469990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.459348Z","title":"Context based emotion recognition using emotic dataset","venue":null,"work_id":"e7448fa6-5e68-418a-aa43-6dd8b741722b","year":2019},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.915705Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:d9ce061b46a694762d406692f71a358bb2548e9f45bd43951d53c04add70f8a9","observation_id":"e14a39e9-8b18-409b-9bd3-98c95ecedd86","resolution":{"observed_at":"2026-08-06T16:16:23.462493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.451327Z","title":"Affection: Learning affective explanations for real-world visual data","venue":null,"work_id":"7fb837ef-768f-43cc-a37f-de3493754d80","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.918286Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:94e43eb993aa8b4cbd477cf67e498bb2a8963dd65c79677f797025c0de4253cb","observation_id":"2c3f3505-e9d2-4a31-8d0c-b20e4d07b3fb","resolution":{"observed_at":"2026-08-06T16:16:23.454385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.921128Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.921128Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:2143b92d74bfacc74ccf6fd982cb788c8e834bf60a3c09514f328753673bb3a0","observation_id":"bb7def94-8608-4d08-a9b6-49c99aac00c2","resolution":{"observed_at":"2026-08-06T16:16:22.921128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.438623Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"91ae4a78-6811-45e6-8ded-9f7e0a8cdaa5","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.923806Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f1536e231c608ff77b2fcd0c3aa9b9cdc254b0bf05b49bc30e7b3a0a7baaa7ab","observation_id":"56efe553-bb1b-4a3e-98bc-d3e76e738786","resolution":{"observed_at":"2026-08-06T16:16:23.441359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.430741Z","title":"Grounded language-image pre-training","venue":null,"work_id":"394bcd39-1add-47ad-b700-f29f1374ce0d","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.926795Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8f026acbfce9213e912ffba45ade1d82228454bf7a0ec499bbde75df135ef177","observation_id":"c851383b-aca0-4240-9b7e-f9af124d413a","resolution":{"observed_at":"2026-08-06T16:16:23.433604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.422917Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"48dba22b-8994-4386-a0d7-3df7373a977f","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.929566Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:d581d1c310ecb9321a7aca87e586b9de3989fae483e6c377201835c5a3233c1f","observation_id":"8c5ef576-b4fb-47e0-8af1-68039c4de425","resolution":{"observed_at":"2026-08-06T16:16:23.425594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.932209Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.932209Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:650aac9014898a9a19f2b0266d53c581f65bf9aac403e23a16b7202b036dc4b7","observation_id":"bf768030-7b73-4354-aa4a-b9f17597512f","resolution":{"observed_at":"2026-08-06T16:16:22.932209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.410164Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval","venue":null,"work_id":"885438fe-5605-4de8-a981-695feb0312c4","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.934777Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:1b859b04230420615eb3e7fe099b56fc709c8dda94124ca80e5fe9430ed6aab3","observation_id":"f9aaf3f0-5632-4102-90d8-502afd57d682","resolution":{"observed_at":"2026-08-06T16:16:23.413095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.402974Z","title":"Videoclip: Con- trastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"00b04320-b4da-4a9a-b6c8-3b6e144ee8ae","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.937349Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:4e6c28bfd87819198cb52ab5f65b88f5f95380aea1c19e4f84c9b432ad6e11a9","observation_id":"64833246-9026-44be-9759-88232931f634","resolution":{"observed_at":"2026-08-06T16:16:23.405627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.395843Z","title":"Vqgan-clip: Open domain image generation and editing with natural language guidance","venue":null,"work_id":"8cab994b-1fcd-4c56-867e-f9641e5e2874","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.939956Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:e9abfa90842adb502879dac5db0a320f1ec4fb4907b8336f9774a689b97da611","observation_id":"2f283955-ccc4-4bcb-a7db-bf489c22a17a","resolution":{"observed_at":"2026-08-06T16:16:23.398373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.388340Z","title":"Clipdraw: Exploring text-to-drawing synthesis through language-image encoders","venue":null,"work_id":"bb4d73ab-d2ad-45e7-8882-0db9937eddff","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.942557Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5445ed6855e4b85ce093ad0c6f8f49498d71a3e91c4b52994a8c1fcc9ef40790","observation_id":"e6ce5e30-90f5-4840-acd9-bf4bd395583b","resolution":{"observed_at":"2026-08-06T16:16:23.391083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.380757Z","title":"Clipasso: Semantically-aware object sketching","venue":null,"work_id":"d8b53f2c-c79d-4563-8ab2-e364bd8a4097","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.948318Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:7d048e3be8dc6648afc57271a632e583b4c851d6e52ffaede39a451c599f48bf","observation_id":"4ab5a89c-71cf-4c5f-bd9f-20b442a3dfd5","resolution":{"observed_at":"2026-08-06T16:16:23.383426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.373108Z","title":"Region- aware pretraining for open-vocabulary object detection with vision transformers","venue":null,"work_id":"0324d4bf-ce0e-4dc4-a9d0-85531ca469e4","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.950693Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:7bda4605f7288aa49e774917c5bc2bfe99f7db13c062a90bc51191c9f216ff8b","observation_id":"3dd52f12-982c-4948-9b87-3e461fbcac4a","resolution":{"observed_at":"2026-08-06T16:16:23.376124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.366109Z","title":"Multi-grained vi- sion language pre-training: Aligning texts with visual con- cepts","venue":null,"work_id":"6137bdf4-be9e-47e8-b418-c55f89848ffb","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.953442Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:0b1ee09b60238f19000424279920c8467cc349f7f228f25d8d80dbdd27e2f250","observation_id":"05342b86-a399-4be6-92f8-3820cb0c2041","resolution":{"observed_at":"2026-08-06T16:16:23.368495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.358722Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"91d4db87-74f3-4efa-87ac-4b8855c3ba28","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.956187Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:ab9526446282f720a067dc5c9605c7cef452c710c580b7042a1182be03f68308","observation_id":"f800d127-454b-427a-88c9-2d3fe836f80c","resolution":{"observed_at":"2026-08-06T16:16:23.361258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.350423Z","title":"Stablerep: Synthetic images from text- to-image models make strong visual representation learn- ers","venue":null,"work_id":"42069bcf-cfc3-416e-b809-d033d7d6eeed","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.958717Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:912f6a21dd9761cb210d3a4a54568c0877664dff8f8d661e1adf5a981bc0983f","observation_id":"43e7e8bf-2377-4353-b572-70111141dc60","resolution":{"observed_at":"2026-08-06T16:16:23.353012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.342239Z","title":"Alip: Adaptive language-image pre-training with synthetic cap- tion","venue":null,"work_id":"55ea75c5-01ef-4a5b-b0ed-ddf5d807f354","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.961302Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8e1dd7f0d5bcc5b9e080d200cf01bb914a7e1b3c7401ff9a7f0b50b3b2b0b786","observation_id":"1e267e81-e89c-4c2d-88e6-b20a7ab52498","resolution":{"observed_at":"2026-08-06T16:16:23.345065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.334429Z","title":"RLEG: Vision-language representation learn- ing with diffusion-based embedding generation","venue":null,"work_id":"8f45e0bb-490c-4bc4-a32d-e1b0886cf99a","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.964447Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8dae3e6b63d9a47025063bead320791f4d18aeb0c38a5af0abf118fb13ac3701","observation_id":"5525f636-7d3c-4d40-9bfc-b93d62dee74d","resolution":{"observed_at":"2026-08-06T16:16:23.336978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.326107Z","title":"Veclip: Im- proving clip training via visual-enriched captions","venue":null,"work_id":"dfba613a-b4f5-46a9-a098-8baee354464d","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.967196Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:ffd87edb0efbbc422b91817e82434af92a19ded90672fa45076d009ff1a76dec","observation_id":"9df5f5f0-c038-4c0a-93ee-b99d4e58a5f3","resolution":{"observed_at":"2026-08-06T16:16:23.328942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.317973Z","title":"Mllms- augmented visual-language representation learning","venue":null,"work_id":"c56847ff-f895-4204-88ec-3e7434c38b5c","year":null},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.969973Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:9d03813c6c681a00635734e5a71b0b636c0680c27b79707de2f342920ac7336e","observation_id":"0b995753-f662-4432-9d04-10fb5ac59f67","resolution":{"observed_at":"2026-08-06T16:16:23.320446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.310294Z","title":"Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron C","venue":null,"work_id":"c5cd5a5a-a8b4-4c3a-b182-2309be1d3a30","year":2014},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.972688Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:e192726e4eaedfe561d5edd3f722975166af1064c36d3578a56d34b763a47f04","observation_id":"2cf9fdd8-a940-4787-903f-801da675c4a4","resolution":{"observed_at":"2026-08-06T16:16:23.313120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.302351Z","title":"Reed, Zeynep Akata, Xinchen Yan, Lajanugen Lo- geswaran, Bernt Schiele, and Honglak Lee","venue":null,"work_id":"d524780d-d9a4-49d9-a4ff-489f784c0424","year":2016},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.975283Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:e1fd05ca9125a5804ff8237ec51698cebb91cd6078f5810f37b8eac1e3d043a3","observation_id":"b044a504-a4a0-4db3-9446-a204010df3bc","resolution":{"observed_at":"2026-08-06T16:16:23.305593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.977966Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.977966Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5d59678009e3ede6f0ef2bd7873a814fcc681d0b61ba786bb003ee3e58820fe7","observation_id":"bdb60db8-e0fe-4641-b12a-d2d8268f44fc","resolution":{"observed_at":"2026-08-06T16:16:22.977966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T16:16:22.980516Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.980516Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:f77662d28b2f1db49bd8757b91c3b834bfa11d61f95c9cbc37d4f40bde90892e","observation_id":"f82156c4-3ac2-42c8-a87b-57084fd48ff8","resolution":{"observed_at":"2026-08-06T16:16:22.980516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.983166Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.983166Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3e76582d1327fc840f3fcf86a50d55d848d325c61697b8214bff5326b0b7e8de","observation_id":"58d6efec-63eb-41b1-92ad-49de25994675","resolution":{"observed_at":"2026-08-06T16:16:22.983166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:22.986293Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.986293Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3051a8ff420d5334a22d5497592e8f48fe0feaaf5cc37e9f98c8a0ee3570145e","observation_id":"336a6147-1e40-4f4d-ad36-fa56875aca9c","resolution":{"observed_at":"2026-08-06T16:16:22.986293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.279268Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":"d1f794ea-96f7-4683-93dc-fe0e7f0bb3a3","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.988791Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:3ad37c6cf306cdd39ef03e5e6189ccf8ae5c943b3a6d82569478814efa1b762c","observation_id":"e5d9f01e-99c7-4b08-940a-4189b236a360","resolution":{"observed_at":"2026-08-06T16:16:23.282580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T16:16:22.991338Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.991338Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:4f927fcb7f9185d9e2a14b2d0952d5dd10cf5ecacabc83a10964cd55e4b97415","observation_id":"88fccf6d-3ef2-43aa-86bf-7647ef034a31","resolution":{"observed_at":"2026-08-06T16:16:22.991338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.270949Z","title":"Imagic: Text-based real image editing with diffusion mod- els","venue":null,"work_id":"243e1c56-fd68-444e-8b89-3e0734c9b5f4","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.994219Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:37d7d56d866140a639f3d094e76785eb9f2d968648a22ff104aef96d8770b76d","observation_id":"a25692c1-301f-4515-8cfc-11db904a8bf8","resolution":{"observed_at":"2026-08-06T16:16:23.273569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.262221Z","title":"Photoswap: Personalized subject swapping in images","venue":null,"work_id":"4a7c0dea-72d7-4452-8608-ab46165a53bd","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.997101Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:25be358618f70e52013977e74f1bd03c13e35ffd3f527f09afa6a1ce3fc7dcaf","observation_id":"b8371a56-ff60-49a5-a60b-b0b7ada78187","resolution":{"observed_at":"2026-08-06T16:16:23.265754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.253469Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":"62424662-0f47-494f-9cfc-633d375a4d86","year":2021},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:22.999712Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:41d401a8620f4ef440e38fe042bfa61f69f3e6e1a3fc45576640c9d6f1c50d6c","observation_id":"4cad8d5d-2db5-43fa-9c22-1bddacf57aad","resolution":{"observed_at":"2026-08-06T16:16:23.256965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.244695Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"65a58bbd-4adf-4256-912b-d9c3e2e44c9f","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.002237Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:b1b03842fe936e69280e7da29e3af2f0148e999e9ebb95218652bb8470e45fe2","observation_id":"4bb41fd0-cda5-405a-81e8-cd574d17da4c","resolution":{"observed_at":"2026-08-06T16:16:23.247595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.236087Z","title":"Fleet, Radu Soricut, Jason Baldridge, Mo- hammad Norouzi, Peter Anderson, and William Chan","venue":null,"work_id":"8171e743-c39f-4ec1-9ffd-aeb65d16d983","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.004766Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:695ff036548dc76a1f1f9b75bcacf7ac063cf58db0cd80ecf8df71dc59da0c15","observation_id":"50ec6452-b21b-4c83-b3c5-c9d64571ff58","resolution":{"observed_at":"2026-08-06T16:16:23.238884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.227368Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"df2043e3-2ccf-49f3-89dd-5f6ec7dd8f79","year":2022},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.007795Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8a5c17c3eedfcd98a29853bdd9e0860887cbea2b5ce7833dd35fca79c9b585c7","observation_id":"24031552-64b3-4588-ae3e-1dbd4feb14c7","resolution":{"observed_at":"2026-08-06T16:16:23.230749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.218637Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":"d34d55c4-b4c5-46d1-8694-b553dfe14615","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.010426Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:ca5ca89493dfc3b049dab3dcac8a5dafa55a73886199d5804b983ea4ac94dd32","observation_id":"b3918f07-5bcf-4b62-8425-5fd8ab8d8395","resolution":{"observed_at":"2026-08-06T16:16:23.221583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.208603Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"c7f17838-b277-40b1-be13-feb3bfc3f094","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.013690Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:4e4f941e1055b81c0f73aca40bb3a8cddce69565d4803eedd15bfdc22fb9f625","observation_id":"ec173cb1-b0de-4fc0-9a88-f046d41c6a97","resolution":{"observed_at":"2026-08-06T16:16:23.211674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.198668Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and edit- ing","venue":null,"work_id":"b1f139e2-0494-4ab7-a911-3e26dbd30567","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.016807Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:d33a64d9eb97882fb2852bc916c1e42f752501f6099cf6de184858f3a4f0fec0","observation_id":"a2f7ea8d-b6d0-4902-bf08-99cbe78be2e4","resolution":{"observed_at":"2026-08-06T16:16:23.202121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00547","last_updated":"2020-06-03T00:31:11Z","snapshot_observed_at":"2026-07-06T09:16:56.708811Z","submitted_at":"2020-05-01T18:00:02Z","title":"GoEmotions: A Dataset of Fine-Grained Emotions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00547","snapshot_observed_at":"2026-08-06T16:16:23.020247Z","title":"Goemo- tions: A dataset of fine-grained emotions","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.020247Z"},"links":{"cited_paper":"/paper/2005.00547","citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:1b625a7ee91ac5569f1a6c9f9969fef70f3ac17ea882d5bb9d109e15eee539e2","observation_id":"ad029215-a9a1-4075-864e-e0ea22373327","resolution":{"observed_at":"2026-08-06T16:16:23.020247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.023182Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.023182Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:9758a9f3583e285cc89274f7d28d427cd1eedef38a1778de5c93cb656449d09b","observation_id":"19a21e28-c53a-497e-b4c7-e81634cf8f07","resolution":{"observed_at":"2026-08-06T16:16:23.023182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.184611Z","title":"Long-clip: Unlocking the long-text capa- bility of clip","venue":null,"work_id":"fc8a0bd5-08fe-4282-af1e-569a7485e474","year":null},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.026065Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:9757ccb8eebce4599b0e218ea4f2c14cb4da68e7330fcae8b926c15ea7a8e509","observation_id":"213342d9-5c3d-45b6-8e79-b8d2cf2034ec","resolution":{"observed_at":"2026-08-06T16:16:23.187454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.176127Z","title":"Ot-clip: Un- derstanding and generalizing clip via optimal transport","venue":null,"work_id":"825eeea8-490d-45b4-8952-26190f7d60da","year":null},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.029267Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:2b9f651e4b0ad63d5206c4e0919bff59b4e1504559247a55377a169b0d58829c","observation_id":"fe8f3162-2965-43bb-bba1-c27873d74269","resolution":{"observed_at":"2026-08-06T16:16:23.179136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.167862Z","title":"Inversion-free image editing with natural language","venue":null,"work_id":"7dbbf0db-77ef-482c-baf5-de20f42b9cf8","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.032328Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:a586d8f9c33af48512e3a0fee8ed0624ac04642b99d5fa783bac023780c98134","observation_id":"079df2a0-8ea6-46e6-ac02-67fdb359c453","resolution":{"observed_at":"2026-08-06T16:16:23.170587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.159336Z","title":"Senticap: Generating image descriptions with sentiments","venue":null,"work_id":"4995a6b0-c5ba-40f1-ab5c-2b97479998b1","year":2016},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.035077Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:23bd8f808ec1ac83d03e34c5ed218715b789c38744cc82c09261a93d374159f6","observation_id":"ceecab97-b51e-4182-b627-727dfcbb5bfe","resolution":{"observed_at":"2026-08-06T16:16:23.162283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.151069Z","title":"Guibas, and S","venue":null,"work_id":"fea1d4b6-6438-443b-9357-964cc3e8120e","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.037817Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:42677b85228e46c63cbb5f4ba9151c1c813138ef0c1aafa0244141031b5189cb","observation_id":"1cb4b0b0-7099-4256-94c6-899afefa74bf","resolution":{"observed_at":"2026-08-06T16:16:23.153802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.143042Z","title":"Kulikov, and Tomer Michaeli","venue":null,"work_id":"131c6301-0cb3-408d-91d5-cf35d465bae7","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.040554Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:5aec07aaf8ed2cf98724c634a56e04abe9f5e2e642b376bcdd3059e428e02ed5","observation_id":"f82649d2-b14a-4b34-b85f-546c803673c0","resolution":{"observed_at":"2026-08-06T16:16:23.146031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.133962Z","title":"Stylediffusion: Controllable disentangled style transfer via diffusion mod- els","venue":null,"work_id":"7af1618f-b722-4e03-94fa-8b485d73c7d8","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.043323Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:d139bca6e41fa831739e04f3deb0b35d4908e73158bc91b8c341ef2f8f5e005b","observation_id":"c7e8ae43-83be-4772-8ae6-671609759560","resolution":{"observed_at":"2026-08-06T16:16:23.136796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.124697Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":"03258576-1b91-4adb-83a6-201e926978d9","year":2023},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.046690Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:80e6e0c3e4192115a9a44e9b2c3db23083db4ec83d1a04a8311e89632ac1234b","observation_id":"1cf93478-9c47-474a-8820-03d88ebbef93","resolution":{"observed_at":"2026-08-06T16:16:23.127688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:16:23.113628Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"b38831c9-fe9f-4352-a832-859626b64bcf","year":2024},"citing_paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:16:23.050134Z"},"links":{"citing_paper":"/paper/2507.14024"},"observation_digest":"sha256:8d88bc83d9eeacc6f244ac1475fcffb6561b3894ee08eda308b7911cccca831e","observation_id":"57e5f660-28b4-421c-aeac-90968aed223c","resolution":{"observed_at":"2026-08-06T16:16:23.118016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14024","last_updated":"2025-07-18T15:52:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T16:09:14.731452Z","submitted_at":"2025-07-18T15:52:39Z","title":"Moodifier: MLLM-Enhanced Emotion-Driven Image Editing"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.14024."}