{"as_of":"2026-08-09T16:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:466b1317be9a0bc26274b4b6b97c9ffc4e7dbab3b075cd06aef8a27a7d7d7abe","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:10:20.833689Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14194/citation-record","integrity":"/paper/2607.14194/integrity","json":"/paper/2607.14194/citation-record.json","paper":"/paper/2607.14194"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.696109Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.696109Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:902f0e7aa2feea4cac24da23f5f97d47c01530964c868a432b667c3036d8b1c6","observation_id":"d298be65-a13e-43c5-a721-1c117fbe1a22","resolution":{"observed_at":"2026-08-02T03:10:20.696109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.702093Z","title":"Pappas, Florian Tramèr, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.702093Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:99319db723b100cf81ba5c06c53bf7583785448224cfa4eaf3d9c43b9cba0128","observation_id":"b2c05b54-3280-4072-90af-3a3f1276bcba","resolution":{"observed_at":"2026-08-02T03:10:20.702093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.704972Z","title":"Video unlearn- ing via low-rank refusal vector","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.704972Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:47180a769bc371979df65ecf25099b37359815bbcfaa2dc8ce385e4f32a7c208","observation_id":"9816861a-bad1-4dbb-bc80-17b517509284","resolution":{"observed_at":"2026-08-02T03:10:20.704972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.707831Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.707831Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:6b13c2f009b9fcc86f32de6db77f781e4d2e4665e0413875242621a662607232","observation_id":"dcf4ec6e-51bf-4093-a7d9-e0b5f3906cde","resolution":{"observed_at":"2026-08-02T03:10:20.707831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.713847Z","title":"Unified concept editing in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.713847Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:0013681da6a2a9c6b113208ef08bd13dc25505cf3625fb68f963d88e1cf9cd83","observation_id":"f8985bde-55b8-4e35-a6be-e5793d88e36a","resolution":{"observed_at":"2026-08-02T03:10:20.713847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73668-1_5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reliable and efficient concept erasure of text-to-image diffusion models","venue":"Lecture notes in computer science","work_id":"0d72ec31-edb5-4157-915c-e27b4eb56896","year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.716446Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:641dda51ae824c2eb77ce81f807a351bf415d09f110d0564fe472bc438a15c4b","observation_id":"f9a116d1-5909-47aa-8d56-0961fdb96d37","resolution":{"observed_at":"2026-08-02T03:13:30.711983Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.718947Z","title":"AnimateDiff: Animate your personalized text-to-image diffu- sion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.718947Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:a58919aa615085e1369cfa521ce317d488f4c91a8a0a2769571c428f6f4963c7","observation_id":"a3f0b53d-fb6c-46b1-ac21-7b84c8ca06fe","resolution":{"observed_at":"2026-08-02T03:10:20.718947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.721907Z","title":"CLIPScore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.721907Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:11cd9e7059afc7d69bbcebcfec1cd0b893a7d4e4e513ef0945b98ec3bcdb9796","observation_id":"f3e7ea34-0f0c-4d22-aff6-32d796139b28","resolution":{"observed_at":"2026-08-02T03:10:20.721907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.724858Z","title":"GANs trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.724858Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:817f4aee053189a7a6d19569f843778d425bb4e0d6a1cba0240f0c6f75c015bf","observation_id":"8c4d10aa-9546-4262-8202-4e05bc54300f","resolution":{"observed_at":"2026-08-02T03:10:20.724858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-02T03:10:20.727566Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.727566Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:93b80d435db645234d234f738eed38ecd2723d59b3c20e62cb3dacf8601a509d","observation_id":"a70bd5b5-6697-400b-a3c1-b897df24fe1b","resolution":{"observed_at":"2026-08-02T03:10:20.727566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-02T03:10:20.730670Z","title":"Gritsenko, Diederik P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.730670Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:e2480f07d93c2957df87f460a8c1041006f59fe9306733507e4816ee06ab628f","observation_id":"ca2290e7-b3a6-4719-8a24-77073e7ad763","resolution":{"observed_at":"2026-08-02T03:10:20.730670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/math13162652","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ConceptVoid: Precision multi- concept erasure in generative video diffusion.Mathematics, 13(16):2652, 2025","venue":"Mathematics","work_id":"4127ba90-2873-4241-803e-9d4e281766f7","year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.736922Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:3e1b8df2881797d41b9ec1a45c1774fd93560bdc90816ce9419c43453c8e2cbc","observation_id":"39bbfba2-597d-4e54-b625-3dd543074ff6","resolution":{"observed_at":"2026-08-02T03:13:30.427384Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.741596Z","title":"Ultralytics YOLOv8.https://github.com/ ultralytics/ultralytics, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.741596Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:ad71e379a5ed07538eec338b380cd6cd9c73aa5245a506f7a350f247680f15d6","observation_id":"fd69fa45-c08b-4c9a-a1bc-8f6722b4182f","resolution":{"observed_at":"2026-08-02T03:10:20.741596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-02T03:10:20.744024Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.744024Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:58ea842e243ace77526362265446d78fd236fb482dba005cf7acaa8f79968bd7","observation_id":"786606b2-0a6d-4f7f-88c1-2e23bf13fcff","resolution":{"observed_at":"2026-08-02T03:10:20.744024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.746993Z","title":"Ablating concepts in text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.746993Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:9f598294163d6763742f5e4c135b9939a878be85c1e5c645e910caefd3553446","observation_id":"54923f54-65b4-471e-a791-3fc9f9a5f3ff","resolution":{"observed_at":"2026-08-02T03:10:20.746993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-01267-0_11","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning blind video temporal consistency","venue":"Lecture notes in computer science","work_id":"191d33bb-e60a-4367-b30f-a5bb5cbe6002","year":2018},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.749732Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:92183be1d6e5018b31cb46bc86a0dd991cd5f9dd1b211325e5a530cbc184ec14","observation_id":"4c34a8d0-f4b6-47c7-9f19-031f9a5f4801","resolution":{"observed_at":"2026-08-02T03:13:30.169596Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16124","last_updated":"2024-07-23T02:10:50Z","snapshot_observed_at":"2026-08-07T22:23:37.324306Z","submitted_at":"2024-07-23T02:10:50Z","title":"Fr\\'echet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16124","snapshot_observed_at":"2026-08-02T03:10:20.752385Z","title":"Fréchet Video Motion Distance: A metric for evaluating motion consistency in videos.arXiv preprint arXiv:2407.16124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.752385Z"},"links":{"cited_paper":"/paper/2407.16124","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:0a9c2618d7499ae921c2eca9c28c37002a7759ef8a54ee237e1f250c8e8e3e23","observation_id":"d8402b28-62ae-4308-9578-0597e1638f05","resolution":{"observed_at":"2026-08-02T03:10:20.752385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.758861Z","title":"Rethinking machine unlearning in image generation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.758861Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:98a317100ed8c0fe8444c36e953deebbf521c50992ae4635ef26c4aeb258b41e","observation_id":"496eb3d4-253d-433e-9b80-8ad9b34f199f","resolution":{"observed_at":"2026-08-02T03:10:20.758861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.761387Z","title":"AutoDAN: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.761387Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:9dc470bc9c4db6255fd95c5e51f052d81e68350e1fce129c3c74f29b5cb05551","observation_id":"614eefaa-da8f-4f41-a2fb-a1ebe897e20a","resolution":{"observed_at":"2026-08-02T03:10:20.761387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.766170Z","title":"FETV: A benchmark for fine-grained evaluation of open-domain text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.766170Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:cfe226369be87882d9f3f32016271efe433a05bb8e4b78bf7a54872450287552","observation_id":"e1f988fa-7a02-49fe-a576-31347066c09c","resolution":{"observed_at":"2026-08-02T03:10:20.766170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.768915Z","title":"MACE: Mass concept erasure in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.768915Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:2b450e8b40980ebb7343b4b25cc3d2794da2183c90b3fa75b438d53d2b99969b","observation_id":"20921480-f05f-42a2-b3e7-4212ee2f8c97","resolution":{"observed_at":"2026-08-02T03:10:20.768915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.771476Z","title":"T2VSafetyBench: Evaluating the safety of text-to-video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.771476Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:fd21ab8e89097c5a430d79a1c774b18c82336244033e2b449d8e34161f68817c","observation_id":"b074e77b-893e-43da-b33a-b9327f72f227","resolution":{"observed_at":"2026-08-02T03:10:20.771476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.774346Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.774346Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:6f0ca52193c687472aad91161f73cc638789d9062f6ae2f0bfdbba1198963023","observation_id":"dac78df0-a9db-42d3-85d7-b438db03ab18","resolution":{"observed_at":"2026-08-02T03:10:20.774346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.777485Z","title":"Girshick, and Ali Farhadi","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.777485Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:2190374df40000c166f25fb7d83719f3b44782dfc117e76456626c82b654c3b4","observation_id":"86d2034f-661f-4b06-93f4-ad5c74f071ab","resolution":{"observed_at":"2026-08-02T03:10:20.777485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.780108Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.780108Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:3ed827b47255a236e1108c2a6d3903f77c661c219312363a6063779a40b2525e","observation_id":"58e3d074-de66-4afa-87a2-efb7b7bce9a2","resolution":{"observed_at":"2026-08-02T03:10:20.780108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.782739Z","title":"Safe latent diffusion: Mitigating inappropriate degeneration in diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.782739Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:f6590d61475f8f9d6cee6597167122afb66ebdc9ad89b3c4404b32a53cabf522","observation_id":"4fc3427b-f4ce-4594-9d11-ee9e29290200","resolution":{"observed_at":"2026-08-02T03:10:20.782739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.787684Z","title":"Multi-task learning as multi-objective opti- mization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.787684Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:54f9113ab0c6a4804e51f434bd0da9338719eefd5acc5c6e1b7f480780331eeb","observation_id":"65680513-5bd5-43c3-8c10-782c11d3348c","resolution":{"observed_at":"2026-08-02T03:10:20.787684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.790164Z","title":"Make-A-Video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.790164Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:9492963b1782b2e3b592e342701ed25a27790ed5f8cbf6991d44994bb87488ac","observation_id":"7856b30d-1fc8-4283-a4ee-1d26084f1aa5","resolution":{"observed_at":"2026-08-02T03:10:20.790164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T03:10:20.795809Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.795809Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:c4af13591ea7e62e27421ddf8b47195555e092cbeb8c5ebabbb154abe374da16","observation_id":"8fb8c749-07fe-4316-89c2-a1f17124dc1c","resolution":{"observed_at":"2026-08-02T03:10:20.795809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-02T03:10:20.799249Z","title":"Towards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.799249Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:e17ce4e4eb548246bff5a377f331f8a5366f2afa40d7c6938178a53b621e763d","observation_id":"7ec1764f-f541-4c54-bc99-9b8d54fb9856","resolution":{"observed_at":"2026-08-02T03:10:20.799249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.801903Z","title":"Erasing undesirable influence in diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.801903Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:1f00aa0e83cdda32c02aee86192a78a073784923897393b1de82eb204f9b33e4","observation_id":"4d8a8ec7-e0c5-48f1-90ed-9c5711274830","resolution":{"observed_at":"2026-08-02T03:10:20.801903Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i8.32917","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unlearning concepts in diffusion model via concept domain correction and concept preserving gradient","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"7fc97cf7-a046-4db6-89a1-5a9905a0cdc4","year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.804238Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:dd8312d633ff5093c90a9aac67f8c4481e9fabcfc4d749030926a0a59fba12e8","observation_id":"308820ca-f4cf-4151-86ac-2f63a170c068","resolution":{"observed_at":"2026-08-02T03:13:29.822150Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.304","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoEraser: Concept erasure in text-to-video diffusion models","venue":null,"work_id":"d874da71-f852-497f-84ab-631468400232","year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.807062Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:0a687699734820a026a6d81b0e4115d727e7103e08fb69c51e93dde3ebf5580f","observation_id":"97acae63-bd99-4720-893c-e1f5a73d82fe","resolution":{"observed_at":"2026-08-02T03:13:29.600277Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.809609Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.809609Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:02baf5f6453bcfb8fae2e374e56976f4dc4d1fec98b8352746c0f8a93e46f4bb","observation_id":"86511bd0-27da-4374-8497-d4a9f36aa711","resolution":{"observed_at":"2026-08-02T03:10:20.809609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.811915Z","title":"T2VUnlearning: A concept erasing method for text-to-video diffusion models.arXiv preprint arXiv:2505.17550,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.811915Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:805617ce1b6733dbac3061464ad4b1b849cdc1e83a5b349a7bf9e6a3dbf5184e","observation_id":"6114f0f3-b51b-4d17-bea4-6bdb8ee281d3","resolution":{"observed_at":"2026-08-02T03:10:20.811915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.817553Z","title":"SAFREE: Training- free and adaptive guard for safe text-to-image and video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.817553Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:06797b0259cbd4407c965594cfc2d4843c1b4fba51ffe3718e547c0e5a7a9ecb","observation_id":"24963687-7541-4ff0-82d5-58c2a6837464","resolution":{"observed_at":"2026-08-02T03:10:20.817553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.820482Z","title":"Forget-me- not: Learning to forget in text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.820482Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:ab9cb9c94c9f4e3105c97af1760bc9f0553e526f790b0828bbe0eb27175b92e0","observation_id":"199501de-e21b-4b8b-aca5-0f22d673fdf2","resolution":{"observed_at":"2026-08-02T03:10:20.820482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.823118Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.823118Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:7e5f3a783a0b6f668a1c2d8f1822cc7cc349eebe9038b8d30711d338bb29da2e","observation_id":"ee57506e-9264-4e54-a24d-4d5cbbc2d1be","resolution":{"observed_at":"2026-08-02T03:10:20.823118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.825809Z","title":"To generate or not? safety-driven unlearned diffusion models are still easy to generate unsafe images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.825809Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:25c8e42463f871ce6d4e331503f667925d3737ab27d55449ec0c6a06f20e63de","observation_id":"43c98ce8-f360-4707-9b52-113e9f70a43b","resolution":{"observed_at":"2026-08-02T03:10:20.825809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-02T03:10:20.828273Z","title":"VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.828273Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:f744701d5d0b14ac7e9f0eff1c55a57a2220c5441a92f10f5fa4fdfab266b186","observation_id":"15ac8e1b-447c-4fa2-a7a5-e38a1072401e","resolution":{"observed_at":"2026-08-02T03:10:20.828273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-02T03:10:20.830883Z","title":"Open-Sora 2.0: Training a commercial-level video generation model in $200k.arXiv preprint arXiv:2503.09642,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.830883Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:d00a7469e67125dc3b6f6a4bc2dff7b137c0b0ae86f02d6ce0bac8fb17baff44","observation_id":"dd0e7d42-f455-4c15-8301-e8f7634e5fec","resolution":{"observed_at":"2026-08-02T03:10:20.830883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-02T03:10:20.833689Z","title":"URLhttps://arxiv.org/abs/2503.09642","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.833689Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:21fc422d5f5a19f67062115f8bc11cbb3b71d17328b4e1ce3a6a3d1830087ada","observation_id":"a8d52b6c-0528-40ae-a657-ef4b2cac58db","resolution":{"observed_at":"2026-08-02T03:10:20.833689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-02T03:10:20.733869Z","title":"URL https://doi.org/10.48550/arXiv.2210.02303","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.733869Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:75186d21b3659b3ac06a68b1589ecab03c54995308000f3c9c51fd77311c902c","observation_id":"c64254dd-0b1f-42d3-a660-7c47ba1a4cdb","resolution":{"observed_at":"2026-08-02T03:10:20.733869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.785465Z","title":"URL https://doi.org/10.1109/CVPR52729","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.785465Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:333f494bee2b8a7af8fda17219cb9e1abe8986c58536a138c6791deb49c8492d","observation_id":"40018701-de89-4768-b3fa-46ee9bb90a9b","resolution":{"observed_at":"2026-08-02T03:10:20.785465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16124","last_updated":"2024-07-23T02:10:50Z","snapshot_observed_at":"2026-08-07T22:23:37.324306Z","submitted_at":"2024-07-23T02:10:50Z","title":"Fr\\'echet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16124","snapshot_observed_at":"2026-08-02T03:10:20.755522Z","title":"URL https://doi.org/10.48550/arXiv.2407.16124","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.755522Z"},"links":{"cited_paper":"/paper/2407.16124","citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:15ac42b04ee2d233d257da16755acc1fb9a7dace8ae9146c089e9430376234ba","observation_id":"672961b1-099d-4857-86ec-f79383e304f4","resolution":{"observed_at":"2026-08-02T03:10:20.755522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:10:20.815048Z","title":"URLhttps://arxiv.org/abs/2505.17550","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:20.815048Z"},"links":{"citing_paper":"/paper/2607.14194"},"observation_digest":"sha256:539cb023ae0940cc84903816d200d6fc2bd44812530113adea813e8fab44c33f","observation_id":"609ba86f-4795-46e0-9b4c-512fbef89d33","resolution":{"observed_at":"2026-08-02T03:10:20.815048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14194","last_updated":"2026-07-15T16:26:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:51:52.137977Z","submitted_at":"2026-07-15T16:26:09Z","title":"Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2607.14194."}