{"as_of":"2026-08-20T05:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28a2d4d10c9bbdd7b98ac5cd36babb8bf57ac354b83d8a3c9e269059fe88876b","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:36.875569Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12100/citation-record","integrity":"/paper/2504.12100/integrity","json":"/paper/2504.12100/citation-record.json","paper":"/paper/2504.12100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.572822Z","title":"Reltr: Relation transformer for scene graph generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.572822Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:dde7d5aaa0afeb7f17fda03ded54b11b8a8ba639056d629f22a1652759d727f4","observation_id":"717878cd-8882-4fd2-ae08-74efe9bda04c","resolution":{"observed_at":"2026-08-16T12:40:36.572822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.759651Z","title":"Sgtr: End-to-end scene graph generation with transformer,","venue":null,"work_id":"5f78b558-07d3-40ad-a284-fa088223d003","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.578475Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:99bfc82b737587b1d2cb001b151d4274faae60c018350aca5554e11a045da4b6","observation_id":"f534cf28-cad0-411d-81f0-0f8b8b3a2541","resolution":{"observed_at":"2026-08-16T12:40:37.763960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.746984Z","title":"Ted-net: Dispersal attention for perceiving interaction region in indirectly-contact hoi detection,","venue":null,"work_id":"540eb7af-1f37-4b0c-974b-f80738b09786","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.582646Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:988124fb911bc64fcdad2cd48f27f45a75acbae2b2b2ae5dc63e4d4d6f16b5a6","observation_id":"f0dfa96d-a69e-4543-923a-2bd1600b12f5","resolution":{"observed_at":"2026-08-16T12:40:37.751043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.735703Z","title":"Mining the benefits of two-stage and one-stage hoi detection,","venue":null,"work_id":"a3966465-90ab-4fcc-a297-e8c67facc7de","year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.587317Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:ee79c2afe3d67a9779c0fb33c8183e36beb671e505d9a9423897828d8a2eb12a","observation_id":"ff547605-35ec-4cc9-be14-5bfa077ee3a6","resolution":{"observed_at":"2026-08-16T12:40:37.740237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.724137Z","title":"Towards hard-positive query mining for detr-based human-object interaction detection,","venue":null,"work_id":"b90b5ae7-a5b2-4698-bc62-5f4adbb8ce1f","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.591479Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:04b664f66303aaf52c938016df4a4d646c1e796d9871db8c7a0808b334da6708","observation_id":"be509ac9-2b29-43ca-b9da-0f734d7ec9ec","resolution":{"observed_at":"2026-08-16T12:40:37.728073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.712003Z","title":"Multi-scale human-object interaction detector,","venue":null,"work_id":"cc394b65-517c-4a25-8ea0-b41c28e42a7e","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.596017Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:9084718e84e9292aeb4892124f69ef04abc0dce1bc6c946574fe665db81bc48b","observation_id":"78c56a81-8fae-4f57-8780-d6168f9a886e","resolution":{"observed_at":"2026-08-16T12:40:37.716436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.599767Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.599767Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:0f10b3cde3982afbf4d9787b72a43cd49c9a0827b6343f090fc1d2339d7710ff","observation_id":"4ca60481-7f2d-4c5d-8d41-b2722c375db3","resolution":{"observed_at":"2026-08-16T12:40:36.599767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.692948Z","title":"Efficient two-stage detection of human-object interactions with a novel unary-pairwise transformer,","venue":null,"work_id":"95ba3f37-8a7d-4f0c-a661-953ba6a22d03","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.603382Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:b58f908ba836f2c0d6dfdc4f2d927c1bf2c410983ae59a50ba6d0ab1418347e2","observation_id":"b32933f6-dfc0-48ca-ab57-6ffb03bfb67b","resolution":{"observed_at":"2026-08-16T12:40:37.697792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.681569Z","title":"Learning self- and cross-triplet context clues for human-object interaction detec- tion,","venue":null,"work_id":"917a435b-601e-4c35-ac38-0ff87a4d8e3b","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.607779Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:a43a6dbb08b727d4ea95ca27fd76ceed6051a34b1d7238db15eaabb75b9313e2","observation_id":"7dbeef5d-7ad3-46c0-92ff-a866643a457b","resolution":{"observed_at":"2026-08-16T12:40:37.685927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.611357Z","title":"Label semantic knowledge distillation for unbiased scene graph generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.611357Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:365a431e35bac99dc2cad41f67d5bd5c17220bc1bdedf0218ec63c91195e5018","observation_id":"4aeec154-593c-4a7f-9cfb-ef786a780d4d","resolution":{"observed_at":"2026-08-16T12:40:36.611357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.663935Z","title":"Drake: Deep pair-wise relation alignment for knowledge-enhanced multimodal scene graph generation in social media posts,","venue":null,"work_id":"c0d38026-2583-4800-b810-44e6a3bc2086","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.614971Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:353f2ef8010156de2ab5062377e900e24934714e195f2f09f04746ac68965c57","observation_id":"ffb0771d-6e0e-4d56-bae4-ef752161b93b","resolution":{"observed_at":"2026-08-16T12:40:37.667629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.651783Z","title":"A novel framework for scene graph generation via prior knowledge,","venue":null,"work_id":"d3d7d9e3-c65f-4cdf-9f33-bdfced6fccb7","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.618711Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:9a86af03fdc87e5138e6c7c6b1b24aa22ecbe348e0cdaa69d87770124a912c92","observation_id":"2609c8ff-df33-4e56-99f9-1f6ab97a4450","resolution":{"observed_at":"2026-08-16T12:40:37.656048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.639702Z","title":"Gaussian distribution- aware commonsense knowledge learning for scene graph generation,","venue":null,"work_id":"6ab51ac7-748d-40b7-9a66-043a8b568373","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.622027Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:203a888eab1257cc3b5a35857be2896cbf394696cbac60f120e50db3738faf87","observation_id":"b7c1ac2d-2eb2-420b-9cbd-3eef468fecca","resolution":{"observed_at":"2026-08-16T12:40:37.644357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.625364Z","title":"Open-vocabulary object detection using captions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.625364Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:9f70e866a62275df4fdc91f0bdec9be4247c4a967a182a47758141fbd890b777","observation_id":"b9140c2c-527e-4373-a2d6-c2c38b88c0c7","resolution":{"observed_at":"2026-08-16T12:40:36.625364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.621499Z","title":"Open-vocabulary object detection via vision and language knowledge distillation,","venue":null,"work_id":"06cfa8a5-9097-474b-b698-f920d8fa0a3d","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.629242Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:0a6fe2dfa06e78b970c7518c3b68d14e07b12ee2059e333102b2fe22b0f170dd","observation_id":"3acf52e4-1adf-41ae-a658-e69dc1eae1d9","resolution":{"observed_at":"2026-08-16T12:40:37.625734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.610170Z","title":"Cora: Adapting clip for open- vocabulary detection with region prompting and anchor pre-matching,","venue":null,"work_id":"ce266b96-3f8c-4d71-81cc-5a8a53d77e59","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.633448Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:ac6581eeea2598a106939d014c50ac2b6716f5c612b97cf796aa5d7280ea75dd","observation_id":"8f42a21a-d955-49d9-9a64-926b6482cadc","resolution":{"observed_at":"2026-08-16T12:40:37.614383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.637053Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.637053Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:3f8148e3ac5b2274a57c6a03e8dfd70460aa9eeff3f56f9b0e8a7110091c24e0","observation_id":"5919ae4a-d0f2-4917-a8ac-e303b7ff9fd2","resolution":{"observed_at":"2026-08-16T12:40:36.637053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.592186Z","title":"End-to-end zero-shot hoi detection via vision and language knowledge distillation,","venue":null,"work_id":"b398b82c-fdd4-4e4a-9734-54e65a8d9360","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.640497Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:282bf2f86c5e1d9828e4dba349a47356ade804a04d8cec257951d3f4a0cce826","observation_id":"d3b7ba9c-aa6e-434a-b6d1-69db2afe9e49","resolution":{"observed_at":"2026-08-16T12:40:37.596135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.578884Z","title":"Towards open-vocabulary scene graph generation with prompt-based finetuning,","venue":null,"work_id":"1207b802-4a3f-446c-b459-fba36766c206","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.644555Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:ed57df9d913aa5a80c480e6403e6dbca2d0d3f3748fbc1224278e58bddbce6fa","observation_id":"8fa79c87-bf90-4eb9-870c-ccdf8193d1b1","resolution":{"observed_at":"2026-08-16T12:40:37.583924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.565265Z","title":"From pixels to graphs: Open-vocabulary scene graph generation with vision-language models,","venue":null,"work_id":"b17d06e1-5c56-476e-887f-7843d8ba943f","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.647924Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:02191cfe9f78456e0f41fc6066e99d05539da3d1115a0d30a22a187dade789ad","observation_id":"84f7ab61-9917-4f35-bf6d-2c5dd3a7178d","resolution":{"observed_at":"2026-08-16T12:40:37.570575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.551767Z","title":"Learning to generate language-supervised and open-vocabulary scene graph using pre-trained visual-semantic space,","venue":null,"work_id":"8cdd0115-9fd0-4431-8911-640f254edda9","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.651225Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:466bbd56301573d8afa92c2b3cdb5ce4c7aa694f12c2c5c6bb7ac7dfc2cb1c56","observation_id":"a89abf90-1eec-4e27-ac82-c158a0b21182","resolution":{"observed_at":"2026-08-16T12:40:37.556559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.539252Z","title":"Diffusion-lm improves controllable text generation,","venue":null,"work_id":"49ca265a-1b08-41b1-97d0-92622c9f9db3","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.654737Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:13b4f2bc86b3010f383aff5840003b7f11fb4b75297f026de101a925d065b586","observation_id":"8502b34d-f72f-4927-a09f-bec2d1971243","resolution":{"observed_at":"2026-08-16T12:40:37.543640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.525312Z","title":"Diffuseq: Sequence to sequence text generation with diffusion models,","venue":null,"work_id":"eabba4d0-d25e-4771-bc49-bbae8a000c48","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.657957Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8162fe578c8ba447b57aad8af78b27257e3e5e584932a99db4c5672b610143b9","observation_id":"f81a6af7-547f-4608-b3ac-41606c1b1999","resolution":{"observed_at":"2026-08-16T12:40:37.529974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.513079Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"cc63450e-1fa4-486e-bbf8-2fd92c82a8d6","year":2016},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.661158Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:bb8cca50a4beec3e6fa8ea1f99132b033dc1f0817fa38af8249818e0c042fa0e","observation_id":"52a50c1e-942e-4bc0-ba40-3064e4eb2515","resolution":{"observed_at":"2026-08-16T12:40:37.517874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.664517Z","title":"Learning to prompt for open-vocabulary object detection with vision-language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.664517Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:79f7058d7c75d2b56099fa138a1be9b5f3580e82fff571a54094018816f7f52b","observation_id":"44cf503e-621b-496f-80fc-723c0bcedf18","resolution":{"observed_at":"2026-08-16T12:40:36.664517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.494608Z","title":"Gen-vlkt: Simplify association and enhance interaction understanding for hoi detection,","venue":null,"work_id":"a26d3aef-ed31-4b17-8136-23c57dc5edaf","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.668622Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:3f282ac45705ba6a2bcd803b755801288566869a026f42bbbedf858df7484caa","observation_id":"2804c3c2-2248-461e-92c7-7d30c2c12b12","resolution":{"observed_at":"2026-08-16T12:40:37.498951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.482496Z","title":"Fine- grained scene graph generation with data transfer,","venue":null,"work_id":"7c0dcfd3-f3be-414d-a0a1-b85985adc2b1","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.672164Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:b56ccdc1740ca7beb750c7d2b34c66c610dfc81d9ed9cd3b10f44ed689da8834","observation_id":"4dcd0709-f6f0-4708-9bea-afc213bf96bc","resolution":{"observed_at":"2026-08-16T12:40:37.486728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.676601Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.676601Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:d1f61bfb7d0c6929c447381fe50330fa4537cdb04a6906693ce606bfa0d5b583","observation_id":"65f3812f-303d-4785-9acd-a9b56e8802cc","resolution":{"observed_at":"2026-08-16T12:40:36.676601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.464429Z","title":"Scene graph inference via multi-scale context modeling,","venue":null,"work_id":"79311238-7838-4832-b627-b2f322116da9","year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.680201Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:bd442d70bbcf19067334c1e1ec2a94c5be49a35117cb2ae48c5280840129126d","observation_id":"6a00eaea-e3f1-4e09-b437-4c23e2e42d75","resolution":{"observed_at":"2026-08-16T12:40:37.468967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.683754Z","title":"Rr-net: Relation reasoning for end-to-end human-object interaction detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.683754Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:65c968238730f320271c37292094f10a043b02edfd6a5a3cad9ac59e0b4209b2","observation_id":"0af91e0c-5d13-47a7-992d-4f55782312ec","resolution":{"observed_at":"2026-08-16T12:40:36.683754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.443589Z","title":"Viplo: Vision transformer based pose- conditioned self-loop graph for human-object interaction detection,","venue":null,"work_id":"4bfd745f-1272-47c4-b275-f4ec2d754934","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.687046Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:12b60f86c1e4ada3380386d5b1af1d901c9df462de626a2334b1f5fcd579ee4c","observation_id":"743e5ee3-4c5c-44f1-8c01-9a6ccaad0150","resolution":{"observed_at":"2026-08-16T12:40:37.448179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.430252Z","title":"Semantically similarity-wise dual-branch network for scene graph generation,","venue":null,"work_id":"86a74785-8b81-4d7d-bb49-73cdc8cff297","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.690439Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:cce05a7f04235a50240356e05b55b5d4eb12dc68305dd719b267d8fbb1b01bc5","observation_id":"d2dd056e-adbb-4ccc-b622-cc0f5ba9b3a4","resolution":{"observed_at":"2026-08-16T12:40:37.435654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.693789Z","title":"Glove: Global vectors for word representation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.693789Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8c0a60affcbfbf57d6042bd51c3565ccbeb4a78533d5cb3e878308c565d5bce9","observation_id":"4d6fa6b6-8668-4cbe-a38f-4faaf8797387","resolution":{"observed_at":"2026-08-16T12:40:36.693789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.410874Z","title":"Deep contextualized word representations,","venue":null,"work_id":"3cafca0a-eace-4ed8-94bb-6bee6c44625a","year":2018},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.697233Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:fac96705295afa727725eaa08f4c3e54459db6cba394491fcc8a947f98000192","observation_id":"5adad995-7a39-45e6-b532-505bced08653","resolution":{"observed_at":"2026-08-16T12:40:37.414700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.701323Z","title":"Zero-shot recognition via semantic embeddings and knowledge graphs,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.701323Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:a1a437c791a9d158fff96b79036811391e1c4261a45a37cda57196dd23ad6cdf","observation_id":"c1fc5a2b-1702-4179-a5e3-afdc55d69c2f","resolution":{"observed_at":"2026-08-16T12:40:36.701323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.393267Z","title":"Consnet: Learning consistency graph for zero-shot human-object interaction detection,","venue":null,"work_id":"5d10eb6f-2f98-460e-95ad-6aeff67ae4c9","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.705898Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:ae293627c2ec76f174a923cbff99656ca438d1f1204c21e4d7a46bbe953f8080","observation_id":"1202e33c-f514-42a9-8954-7e59b269581e","resolution":{"observed_at":"2026-08-16T12:40:37.397552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.382185Z","title":"Detect- ing human-object interactions via functional generalization,","venue":null,"work_id":"9b083fe5-c818-4397-902f-4b99e9e10e5d","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.710228Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:11a957d6b9f94cc8d63c97a3d2b3a7a5c608f21bd08b005fa202d78e9a3bff59","observation_id":"49ff9884-3e7b-4406-8c66-57fe3eb5470b","resolution":{"observed_at":"2026-08-16T12:40:37.386323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.370898Z","title":"Multi-grained vision language pre- training: Aligning texts with visual concepts,","venue":null,"work_id":"49d54d5f-5504-47ef-9333-8661006a9d42","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.714380Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:55a74ce3746ae37ff3b02431eefd13f670f515d2db1a88dd1fe31795c89a25e9","observation_id":"aadbf0ba-a456-4bb3-9b6e-551e5c013d6d","resolution":{"observed_at":"2026-08-16T12:40:37.374748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.359076Z","title":"Debiased contrastive learning,","venue":null,"work_id":"3b10da2b-5757-4c23-bc80-783737944753","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.717990Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:73528c9bbdca9fcb6154d574c930e6e5c779bca1b800c0aff98a6b180bfe3950","observation_id":"8e3c03a3-0f49-4ca7-acb6-86fc06b45480","resolution":{"observed_at":"2026-08-16T12:40:37.363176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.721282Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.721282Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:49d7b028b5d1761c8388b358263c5dae61ba2d654549857289b95090d004d17f","observation_id":"9a27542e-5b81-4b6c-ae18-771fa430ff5a","resolution":{"observed_at":"2026-08-16T12:40:36.721282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.725107Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.725107Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:799489fbc51965ac4cbe9e2a80ac29a815beb87e864826ead29a383f29227acc","observation_id":"062d4e99-d0ed-4165-b48f-28735110b5c1","resolution":{"observed_at":"2026-08-16T12:40:36.725107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.332118Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling,","venue":null,"work_id":"098d32e8-f0dc-46c8-8b80-35f338eb3013","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.728638Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:f0fcb067bb05998597291eeed944d5613747a3a24a7e1315205add27f3d1aba0","observation_id":"2bb119fd-dba5-4ae2-91cd-cb5215c0f1f8","resolution":{"observed_at":"2026-08-16T12:40:37.336571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.319948Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"94d194f3-d970-4737-b42e-ff1c4950125a","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.732036Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:d44b6f882d4fb531d703c6a68b651170bf028ceeefe2d0dca162d970a62834e8","observation_id":"a288b665-7d88-4721-bd5a-ccb212964cd8","resolution":{"observed_at":"2026-08-16T12:40:37.323979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-16T12:40:36.736239Z","title":"Dif- fwave: A versatile diffusion model for audio synthesis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.736239Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:023c58d3856f1c7d67212e25ebab7695ff55da768b0b7166f4d379bfdadf9672","observation_id":"f488974e-2803-419c-b652-8d21ae726d55","resolution":{"observed_at":"2026-08-16T12:40:36.736239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15370","last_updated":"2022-05-30T18:30:20Z","snapshot_observed_at":"2026-08-16T16:56:32.342794Z","submitted_at":"2022-05-30T18:30:20Z","title":"Guided-TTS 2: A Diffusion Model for High-quality Adaptive Text-to-Speech with Untranscribed Data","version":1},"cited_work":{"arxiv_id":"2205.15370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.15370","snapshot_observed_at":"2026-08-16T12:40:36.966459Z","title":"Guided-TTS 2: A Diffusion Model for High-quality Adaptive Text-to-Speech with Untranscribed Data","venue":"cs.SD","work_id":"34274ebe-fc14-4f97-9db4-f8519ad0c128","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.740703Z"},"links":{"cited_paper":"/paper/2205.15370","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:0a7ffe5f29427b82941e86b1dcb14ba07dd59ca9bff1a7466915ebb1dc4c5bf6","observation_id":"cddd6105-1648-46ac-96dd-2d4bbdf0b752","resolution":{"observed_at":"2026-08-16T12:40:36.972738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.308915Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning,","venue":null,"work_id":"2bf8c92f-d211-4177-9227-7e701466dd18","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.745507Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:088c08ffd8c4f37d780be01dadc74771f2342f5f2ba04a994608eb53c957453a","observation_id":"c3644db7-80b5-4adf-bc6d-73de10dc4a20","resolution":{"observed_at":"2026-08-16T12:40:37.312657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.298215Z","title":"Semantic- conditional diffusion networks for image captioning,","venue":null,"work_id":"a8704105-e6a2-4f05-8a9c-66e3dfcc8113","year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.749440Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8125c156bae331e8b401714a0d0b8737698df2f9347d7905e8af59fb8dff1b80","observation_id":"2d7eaca8-cab7-4a6d-9521-58ae73430f05","resolution":{"observed_at":"2026-08-16T12:40:37.302018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.285835Z","title":"Diffusion-based multimodal video captioning,","venue":null,"work_id":"ae465bc8-85dd-458b-a340-083a693fbf8a","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.754057Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:6d1ba3da500b329e55da119b1bc01f15530c6f9ac1f5694daf0c859b43285b31","observation_id":"889e233e-5ec9-4646-bb4f-1098fe71f332","resolution":{"observed_at":"2026-08-16T12:40:37.290225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11694","last_updated":"2022-12-09T17:38:58Z","snapshot_observed_at":"2026-08-16T16:14:27.145212Z","submitted_at":"2022-11-21T18:12:53Z","title":"Exploring Discrete Diffusion Models for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11694","snapshot_observed_at":"2026-08-16T12:40:36.757655Z","title":"Exploring discrete diffusion models for image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.757655Z"},"links":{"cited_paper":"/paper/2211.11694","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:ffd857a62e5beea0e1af6dad911f591a69ea16bc0251bfaf6784e70362c1971f","observation_id":"66a8c3c0-060f-422f-bbe9-60b65ffd473e","resolution":{"observed_at":"2026-08-16T12:40:36.757655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.274320Z","title":"Image captioning with masked diffusion model,","venue":null,"work_id":"519c9b00-9366-4e12-be74-d4545d02c1f7","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.761585Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:1d4092088a8fbeee9d93fb7189a8f575afeecdaa6818c839fdef86a17f9a479b","observation_id":"6d1d97cc-c66b-4bf7-87a8-90f77568ccdf","resolution":{"observed_at":"2026-08-16T12:40:37.278220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.765224Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.765224Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:c655f1320253b2750353106f3cfc62299bc1f88f4877d3cd103ba4a995583853","observation_id":"1ced75fc-0263-4db3-8eab-54eef000b784","resolution":{"observed_at":"2026-08-16T12:40:36.765224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.769515Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.769515Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:0477893a79038fcb1545b8c6711cb9c0cb2746e7646b7d7f9d6047fccd17d627","observation_id":"98910a05-00ab-4af2-bd1b-711232f43c62","resolution":{"observed_at":"2026-08-16T12:40:36.769515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.774301Z","title":"Improved denoising diffusion probabilis- tic models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.774301Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:d430203d492552573abb6bfe0698f2c63ddcb0db65f5b41e81801572323412fa","observation_id":"7627c418-b48a-4ad4-9059-0eff49c1e5d0","resolution":{"observed_at":"2026-08-16T12:40:36.774301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-16T12:40:36.777658Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.777658Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:a2a6ea3f77690875d4c0646aba23d602434a1709cbb44d346a2f832aee6ed56f","observation_id":"7681d904-e3bc-4d54-abc0-64f35bec9f78","resolution":{"observed_at":"2026-08-16T12:40:36.777658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11970","last_updated":"2022-08-25T09:55:25Z","snapshot_observed_at":"2026-08-19T23:51:12.297696Z","submitted_at":"2022-08-25T09:55:25Z","title":"Understanding Diffusion Models: A Unified Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11970","snapshot_observed_at":"2026-08-16T12:40:36.781378Z","title":"Understanding diffusion models: A unified perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.781378Z"},"links":{"cited_paper":"/paper/2208.11970","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:0ac62fbcbc235367d5e59fe05a504ae31a3a9b854fd71898282d4ffe427845b3","observation_id":"252840e3-136c-4a6c-8c4b-029668ed30d8","resolution":{"observed_at":"2026-08-16T12:40:36.781378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.786041Z","title":"Variational diffusion models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.786041Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:e5aeae3ff281d25815dd178dde80a63ce093d45771534a836495351ad77ad355","observation_id":"2ea03c6e-e39e-4a75-9139-2e05af959634","resolution":{"observed_at":"2026-08-16T12:40:36.786041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.238537Z","title":"Ladder variational autoencoders,","venue":null,"work_id":"1e356b12-5171-445f-856b-b3cf51a4e29f","year":2016},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.789390Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:90431a0d64f92cef58451502182671a76b6db7c2bb885f01819fffec4ef0ed4e","observation_id":"eb579e96-3e20-4dc1-b4e6-c73484833bbf","resolution":{"observed_at":"2026-08-16T12:40:37.242343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.793055Z","title":"Improved variational inference with inverse autoregressive flow,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.793055Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:adc111cd4876d222a478e990633238ce7da20e126e6e9efbf0926096a1494a29","observation_id":"424738ea-feef-483f-bff6-0fd0860d18fb","resolution":{"observed_at":"2026-08-16T12:40:36.793055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.220753Z","title":"Diffusion autoencoders: Toward a meaningful and decodable represen- tation,","venue":null,"work_id":"cf15e471-7861-4dff-b9bb-3ed31ebf5d4b","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.796396Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:cf9ad4ed454d74e18bfc54bad39341602565f016de91f2e9a0ccd336a5ec5204","observation_id":"e3b3b019-5138-425f-aa78-20638b0ceec8","resolution":{"observed_at":"2026-08-16T12:40:37.224722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.799945Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.799945Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:dc9bfe6732d0fad1e86b51a873ac2c4db724183912d70cd22eb28da3db7d3a82","observation_id":"768e62a4-c505-4223-baaa-97af323a5cbe","resolution":{"observed_at":"2026-08-16T12:40:36.799945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.201976Z","title":"Algorithms for the assignment and transportation prob- lems,","venue":null,"work_id":"70169c6c-fef4-40ac-9de1-eccd77ad05f6","year":1957},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.803434Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:e455f0c4dc7b7283e74f44efeed7c08e39111c7cbb2e6dcb3f99b188ae1b5aea","observation_id":"29290367-f6ca-47e5-9336-5737dfdd92fb","resolution":{"observed_at":"2026-08-16T12:40:37.207193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.190754Z","title":"Nicest: Noisy label correction and training for robust scene graph generation,","venue":null,"work_id":"360f3c2e-4409-405b-8092-e10f9965ff9b","year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.807037Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:682b1cb9b95be94e777df081633e54b77c626a8bfe9e83dd4aa725350c9f66ac","observation_id":"5955a928-ef2f-466e-ac92-d2db3c43e99d","resolution":{"observed_at":"2026-08-16T12:40:37.194492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.179665Z","title":"Spatially conditioned graphs for detecting human-object interactions,","venue":null,"work_id":"66ae4d03-c41e-48cf-9f9c-3c6af24d8332","year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.810449Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:79a0b7f83bf99d5c181f95998e74802ebf66340946d36591f7fb72877b94e3c5","observation_id":"a80f8b07-b43d-4d01-8af3-c3c2cff66e24","resolution":{"observed_at":"2026-08-16T12:40:37.183562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.167717Z","title":"Learning to detect human-object interactions,","venue":null,"work_id":"a95fd278-4a40-484d-ad82-dc77b7155861","year":2018},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.813980Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:72fbf605e60fb6f87bfada50d0ba2b6ffcd02169adc2d578d4199b7b2ab4e937","observation_id":"2062b36a-adef-48b4-9a94-3219f3c8e3ba","resolution":{"observed_at":"2026-08-16T12:40:37.172079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04474","last_updated":"2015-05-17T23:21:35Z","snapshot_observed_at":"2026-08-19T22:00:06.074211Z","submitted_at":"2015-05-17T23:21:35Z","title":"Visual Semantic Role Labeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04474","snapshot_observed_at":"2026-08-16T12:40:36.817138Z","title":"Visual semantic role labeling,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.817138Z"},"links":{"cited_paper":"/paper/1505.04474","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8f83811cc18c26cd3058e8e38d9ec06c95b503ed44dbb47671bc0e5f3608ed2e","observation_id":"c9b6a6da-0feb-4613-9302-4d285af1e6f7","resolution":{"observed_at":"2026-08-16T12:40:36.817138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.821030Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.821030Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:74452abd7944dee78e20c7f1b04d6b50daa4c873e9982a69797c8d534daff477","observation_id":"668a35ee-f352-496e-900b-25327772e882","resolution":{"observed_at":"2026-08-16T12:40:36.821030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.148682Z","title":"Scene graph generation by iterative message passing,","venue":null,"work_id":"bbb3d1ed-651d-4e73-a957-577106b978e5","year":2017},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.824360Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:9b69b2bd99f4020208260250196929991e3a5fc5ebec94fd32cc71383e878e8f","observation_id":"d4e29bd8-b578-4c1e-9a1a-e172a7d95bd2","resolution":{"observed_at":"2026-08-16T12:40:37.152786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.136994Z","title":null,"venue":null,"work_id":"2e0ae725-4820-4098-b34f-1e48601eac26","year":2009},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.828190Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:78bb1bc50d476905b170c4c6e87e9ad7551705771ad55286f3d5a7a40a7fe18c","observation_id":"c57b67ba-e32e-494e-bf5f-584cece3fba3","resolution":{"observed_at":"2026-08-16T12:40:37.141167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.125593Z","title":"Generating semantically precise scene graphs from textual descriptions for improved image retrieval,","venue":null,"work_id":"237846a3-b8b2-4451-a74d-437b87164f55","year":2015},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.831387Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:25fe3877168bc42906ede652f993a8b579e48fe02d7a0a403cd6b3d814e08364","observation_id":"043bbf89-bb48-476f-97b6-f1da6a91d94e","resolution":{"observed_at":"2026-08-16T12:40:37.129451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.112675Z","title":"Learning transferable human-object interaction detector with natural language supervision,","venue":null,"work_id":"07eef0a4-9073-4d77-8e39-1add8850585b","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.834761Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8e5bce2137d1aabbe5818764a9d7f7d594700efc7667780d9abe4267f22e1a4d","observation_id":"afa95e82-6fbc-40ae-9f31-a6e9f62cd5f5","resolution":{"observed_at":"2026-08-16T12:40:37.117347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.101053Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework,","venue":null,"work_id":"4b7f2ed7-0844-474d-b173-961973fa9c62","year":2022},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.838057Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:59ff26a116ebfcf83ba2f92ec29ec1bb5d227cabf1ade2da8ac463a8788b41a4","observation_id":"08d3a9c2-be84-46ac-946e-921eae60f55b","resolution":{"observed_at":"2026-08-16T12:40:37.105155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.841469Z","title":"Exploring conditional multi- modal prompts for zero-shot hoi detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.841469Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:b4cedc07da1365cf41366e219c29f113c03a134c7099a6f66ed6ef3eb3bb31f7","observation_id":"d5366876-d9d2-4c45-b22a-36d744b1abdc","resolution":{"observed_at":"2026-08-16T12:40:36.841469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.082009Z","title":"Pcpl: Predicate-correlation perception learning for unbiased scene graph generation,","venue":null,"work_id":"5469a992-9219-48d9-b5af-652f24bd8cb5","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.844906Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:dd251f0bdbec16d1cef03f8fd5d77b21c613dd7522afe4de4cfb738b4b9ccf95","observation_id":"a05771af-4d5c-4963-bf5e-2ca7361f7fae","resolution":{"observed_at":"2026-08-16T12:40:37.086216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.069483Z","title":"Neural motifs: Scene graph parsing with global context,","venue":null,"work_id":"1f3d874b-375b-4763-8812-f2e206db6fc6","year":2018},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.848274Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:ba8b25d7a1fe8fa1db44e11e0712b766718f068d1a341158ad2fb19d68c03d60","observation_id":"b9bbf67a-15a9-4708-af26-59ee35a790c4","resolution":{"observed_at":"2026-08-16T12:40:37.074459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T12:40:36.851652Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.851652Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:9916e6917b121b851dbbc3714072124a181c6caca93fab8c80788ff9e42295d0","observation_id":"bc272298-efc8-4a00-a357-d33e1504e8cc","resolution":{"observed_at":"2026-08-16T12:40:36.851652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.057444Z","title":"Learning to compose dynamic tree structures for visual contexts,","venue":null,"work_id":"2db8a8e5-f52c-4e6c-b55a-2f0d6cb4e52f","year":2019},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.855488Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8b51c5087245bc6f3f9555d3b9f6a914584b0575da3be7e321f437ad2e6befc7","observation_id":"4ce10ec4-3777-4043-bac4-9576ebc98824","resolution":{"observed_at":"2026-08-16T12:40:37.061551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.046375Z","title":"Unbiased scene graph generation from biased training,","venue":null,"work_id":"8981157a-9dfc-43e1-9ea7-f10725af3ec2","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.859183Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:2e2fc55742a360aad9370ec1e4c28227fbf8e45ab60b1895364ea1a9099786f5","observation_id":"fdfbb514-69b7-4957-ac14-2f3c7c16239d","resolution":{"observed_at":"2026-08-16T12:40:37.049993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.033503Z","title":"Cogtree: Cognition tree loss for unbiased scene graph generation,","venue":null,"work_id":"a8cba897-fc6d-4165-bb85-6ac776c9882f","year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.863548Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:41d34c49cf3a488697700ef06d7dcaa8beeba4a3aa7e00cfc33a4dba7255d053","observation_id":"2429be1e-9404-47c2-a347-9bce6e31cb03","resolution":{"observed_at":"2026-08-16T12:40:37.038134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.021396Z","title":"Improved techniques for training score-based generative models,","venue":null,"work_id":"98c2408d-d674-4341-96f9-6d5f87d1f19a","year":2020},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.867924Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:8afe1afc534212c11e051d78569744927b6a7dce9577956f38af362b89b91466","observation_id":"4c69585d-de6c-49e8-be99-cd13310c4266","resolution":{"observed_at":"2026-08-16T12:40:37.025618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:37.007272Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"10d65401-069d-4370-bcb9-2b62caf529bc","year":2021},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.871709Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:32a6bfccd13d9a0b239ae4a82d9ea501896c141dab8dba0c9cb8442caabf03e7","observation_id":"d0074fe7-6e3a-481e-b5d8-2486f4e72162","resolution":{"observed_at":"2026-08-16T12:40:37.012032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:36.992948Z","title":"His cur- rent research interests include computer animation, multimedia retrieval, and machine learning","venue":null,"work_id":"0fcd1069-e0ad-4e86-bd8a-504a30c438b5","year":2018},"citing_paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:36.875569Z"},"links":{"citing_paper":"/paper/2504.12100"},"observation_digest":"sha256:290ea5b56b1b170c6660bab4c4f4e6ad16a71486a49b4adcae00f0627d948016","observation_id":"f0cdf4f6-5309-4b39-a964-692f6ac8465c","resolution":{"observed_at":"2026-08-16T12:40:36.997959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12100","last_updated":"2025-04-16T14:03:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T21:14:45.090906Z","submitted_at":"2025-04-16T14:03:24Z","title":"Generalized Visual Relation Detection with Diffusion Models"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2504.12100."}