{"as_of":"2026-07-25T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:322bd5dbbc479317d638a4de2a8c8ad6ee6759bf001974eae2aafe25bc36a23f","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:45:35.601179Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-24T06:31:00.690269+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T23:15:09.253879Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T23:19:02.549105Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"cited_work":{"arxiv_id":"2606.27192","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.27192","snapshot_observed_at":"2026-07-03T23:19:02.549105Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","venue":"cs.CV","work_id":"1b010584-596c-4d81-8e7a-74a37410dce5","year":2026},"citing_paper":{"arxiv_id":"2606.23041","last_updated":"2026-07-02T11:57:59Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:48:19Z","title":"SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-03T23:15:09.253879Z"},"links":{"cited_paper":"/paper/2606.27192","citing_paper":"/paper/2606.23041"},"observation_digest":"sha256:f7bd9c94195e6c65c4e4a392d81b7ca124f80e385e537e6fcd0e90378e381377","observation_id":"6aaa6fc8-0fb9-419b-bbf3-46809e7c7a22","resolution":{"observed_at":"2026-07-03T23:19:02.551293Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.27192/citation-record","integrity":"/paper/2606.27192/integrity","json":"/paper/2606.27192/citation-record.json","paper":"/paper/2606.27192"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.13606","last_updated":"2021-11-26T17:10:07Z","snapshot_observed_at":"2026-07-06T12:12:32.184432Z","submitted_at":"2021-11-26T17:10:07Z","title":"Conditional Image Generation with Score-Based Diffusion Models","version":1},"cited_work":{"arxiv_id":"2111.13606","doi":"10.48550/arxiv.2111.13606","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.13606","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Valentin De Bortoli","venue":null,"work_id":"95354c68-dd73-4c05-8c6d-e9e7d25f7c8b","year":2021},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2111.13606","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:e32fcbc831974d4262aa8f3090c2c283449421e2da459cba6644607b02293b76","observation_id":"8c6b9147-983a-460c-ae24-58b81c8683a9","resolution":{"observed_at":"2026-07-04T12:59:52.006190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T02:27:48.842637Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:a379773b7d3ce577074ad8b196603e335087c85489d893b1d9455cc0fe432a5f","observation_id":"c72011ad-c5a4-4f07-b852-d74cd6aa5c64","resolution":{"observed_at":"2026-07-04T12:59:51.979451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:38a4404c1ef9cde16a100f87597d05f74e69227e9eb08daceb812b82b8a003d6","observation_id":"fc8dc06c-4120-47a9-8b7a-5c8ca8a824f7","resolution":{"observed_at":"2026-07-04T12:59:51.993020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:a69b11770dca046c6f114441ed6bbbef8c389634c4359eeb78b9f1d8a79e5213","observation_id":"15bd2b34-3681-496a-820e-c001a81dd89e","resolution":{"observed_at":"2026-07-04T12:59:51.976897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01409","last_updated":"2025-03-26T20:53:45Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T18:55:04Z","title":"JOG3R: Towards 3D-Consistent Video Generators","version":2},"cited_work":{"arxiv_id":"2501.01409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01409","snapshot_observed_at":"2026-07-04T12:59:51.966994Z","title":"Jog3r: Towards 3d-consistent video generators.arXiv preprint arXiv:2501.01409,","venue":null,"work_id":"0b7c9f23-b7cf-4dc0-a015-253c59686a98","year":null},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2501.01409","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:b3da1a7409bdd17ef9bc8123d33200c846b97f2f60af35cbce4caa1aedecb981","observation_id":"4faa256e-2971-44d1-8535-30fd00cfdde8","resolution":{"observed_at":"2026-07-04T12:59:51.968769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-07-06T14:53:31.395955Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":"2302.09778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-07-04T13:49:51.369751Z","title":"Com- poser: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":"3b80adbe-387d-4b0b-b5f9-5c1013348584","year":2023},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:a723d9710fc7222b19492dd4974b5482afb1f30b750d9d8b08ae99142cd878d0","observation_id":"faba3b6e-1be9-477e-a9f5-3819bf35e2d8","resolution":{"observed_at":"2026-07-04T12:59:52.000937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14080","last_updated":"2021-05-28T19:48:51Z","snapshot_observed_at":"2026-07-06T11:13:51.821442Z","submitted_at":"2021-05-28T19:48:51Z","title":"Gotta Go Fast When Generating Data with Score-Based Models","version":1},"cited_work":{"arxiv_id":"2105.14080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.14080","snapshot_observed_at":"2026-07-04T12:59:51.960524Z","title":"Gotta go fast when generating data with score-based models","venue":null,"work_id":"020cfe2a-ca4b-40ea-bc2d-53d06a2194b6","year":2017},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2105.14080","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:4ad13a9eaadaec79a9d3d7fd311b71515be808cc34a4a44e94aa01c0ec2b839b","observation_id":"88032ba2-0f90-40b3-8127-24bc21f2cc8d","resolution":{"observed_at":"2026-07-04T12:59:51.962526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:e2cd55c5bcfe0bad90399edc8f0438ae9a2da5d7db4e0cb4257fa899a154b6de","observation_id":"7acfd598-0527-4c3c-9148-7d32fba3d794","resolution":{"observed_at":"2026-07-04T12:59:51.965771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-10T17:37:26.212817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:45b71aa7eb601c40b71a6b3a5f284220be52ba96e14a718d4c5afecb5fa1087b","observation_id":"9da70663-b527-4b3a-b2c8-9c60dada74d8","resolution":{"observed_at":"2026-07-04T12:59:51.984812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:226ea7355a87e6a900c6b5a88fa50a364253a28711102b3283517a7f55956c56","observation_id":"6936b826-8917-486c-8b8a-a2a8d27389d8","resolution":{"observed_at":"2026-07-04T12:59:51.956121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-11T00:07:42.299741Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:08adbf42791bac7505b10acbf632b7a02d2a3780f555258f6b8ffbf984845bd1","observation_id":"e21cb7b6-aa3a-446a-8b32-d888fc8f46bb","resolution":{"observed_at":"2026-07-04T12:59:51.959272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":"2408.06070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-07-04T12:59:51.980558Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":"ff8b3345-a8d1-460b-adcb-e219c58680c0","year":2024},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:d85ce87da2589248d6a61568911b27159c13a69fb22e3372f6261db22d120002","observation_id":"b77dc4b3-1966-4d6f-9f3d-9eecbe3088b4","resolution":{"observed_at":"2026-07-04T12:59:51.982304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:45:35.601179Z","title":"W¨urstchen: An efficient architecture for large-scale text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:d87669fef9d3838237cced933ed340e0aa7bdbee50f1d502d815325de176bae2","observation_id":"fc5c02c3-7aee-4879-9f87-8d0d91d2dde5","resolution":{"observed_at":"2026-06-26T05:45:35.601179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:45:35.601179Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:81d6dd8c52a493ebfc513be70d1b278cf8b0bceae18527bb4e9a7d7e115455fd","observation_id":"6eb50208-f89c-44c7-bd07-7a4c36a2ead8","resolution":{"observed_at":"2026-06-26T05:45:35.601179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:3092a9453126ba36468cf8577ddf4e999154aae8dec0571fabc69cb91377d34b","observation_id":"1de88ba1-bf4f-4f34-8d59-ce7811b2b042","resolution":{"observed_at":"2026-07-04T12:59:52.003489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:f79252885a50ccb49e270e40e761b69098e14d276933684b637220ebc3685268","observation_id":"f92206e6-ceda-4c2d-aecc-db3a129d26dc","resolution":{"observed_at":"2026-07-04T12:59:51.974325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:7ec848d6d647937f509a24207794d6b3513a27014ca46a4ffa937c73d010d8ee","observation_id":"2d2177cd-6e4e-40c1-b015-311863195f3b","resolution":{"observed_at":"2026-07-04T12:59:51.995553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"cited_work":{"arxiv_id":"2507.07982","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07982","snapshot_observed_at":"2026-07-07T14:33:54.305490Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","venue":"cs.CV","work_id":"7c214f4a-d3ff-48e7-bd13-043eb9c139cb","year":2025},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2507.07982","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:222b8934c0625a6c9c3b0a44412733d4df97c2077416c9a29235c15ab7b90d76","observation_id":"025bf58e-5136-4fc1-b2d5-7d2ffe3cb8ca","resolution":{"observed_at":"2026-07-04T12:59:51.998030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:45:35.601179Z","title":"Articulated pose estimation with flexible mixtures-of-parts","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:221d638bb82470ea12d9853384f39852840e00f39ce8ad31f77ea89b537f9354","observation_id":"9ad356c8-ea64-40db-8eed-e785204d6dcb","resolution":{"observed_at":"2026-06-26T05:45:35.601179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-07-10T08:36:59.774135Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:aa553a1f5f6746f447fe495554fbd38948af1912c1b478b4f2dbeaf8f3205a96","observation_id":"38e6a092-c1b6-4b7d-9ca0-9d6c8b186fd9","resolution":{"observed_at":"2026-07-04T12:59:51.971586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09139","last_updated":"2019-10-21T03:56:51Z","snapshot_observed_at":"2026-07-06T08:30:55.028616Z","submitted_at":"2019-10-21T03:56:51Z","title":"DwNet: Dense warp-based network for pose-guided human video generation","version":1},"cited_work":{"arxiv_id":"1910.09139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.09139","snapshot_observed_at":"2026-07-04T12:59:51.988925Z","title":"Dwnet: Dense warp-based network for pose-guided human video generation","venue":null,"work_id":"8284f306-ae41-4d1e-8445-bdb3a762d556","year":1910},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"cited_paper":"/paper/1910.09139","citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:f2d0dd456efca2bb0339e21aea0e2fa97a3a1be6a303df99a51de74189a5d69d","observation_id":"c0ae6478-e742-4d8d-84ec-4150e6f829cb","resolution":{"observed_at":"2026-07-04T12:59:51.990615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:59:51.986063Z","title":"Endless World: Real-Time 3D-Aware Long Video Generation","venue":null,"work_id":"87a71b31-205e-438e-a36b-0f07cf429d37","year":2025},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:895c5f1d456397671b3d051face4b2d201352effd8d5eb6751f760fc5d748122","observation_id":"40ff949e-cd37-4110-90ae-cb72b194f2c7","resolution":{"observed_at":"2026-07-04T12:59:51.987817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:45:35.601179Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T05:45:35.601179Z"},"links":{"citing_paper":"/paper/2606.27192"},"observation_digest":"sha256:edfecc2a85245eb60721b99a6a285b0106b036eda92b3b87401750de729beb77","observation_id":"081333df-efe0-4785-a2fa-cffd4033afdf","resolution":{"observed_at":"2026-06-26T05:45:35.601179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.27192","last_updated":"2026-06-25T15:52:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-07T00:01:24.919835Z","submitted_at":"2026-06-25T15:52:39Z","title":"LISA: Likelihood Score Alignment for Visual-condition Controllable Generation"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"thesis":"As of 25 July 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2606.27192."}