{"as_of":"2026-08-06T06:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b7fc02ccffc6edd156d09cf5038f8eb7eda632e162aa161c0c838e554abf35e","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T14:58:27.176375Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T14:58:27.176375Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T03:37:36.092730Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"cited_work":{"arxiv_id":"2606.10046","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10046","snapshot_observed_at":"2026-07-03T03:37:36.092730Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","venue":"cs.SD","work_id":"516e2b2a-1ce2-4145-be48-bd46a71e6c01","year":2026},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2606.10046","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:f81b4f97cdcedde231a7417bdf3ebc0a996a10977011a31e4fbeafb30f1fcf3a","observation_id":"45dad634-6577-4fbe-89a4-b3212a697f3d","resolution":{"observed_at":"2026-07-03T03:37:36.094295Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10046/citation-record","integrity":"/paper/2606.10046/integrity","json":"/paper/2606.10046/citation-record.json","paper":"/paper/2606.10046"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Modern au- dio foundation models integrate continuous flow matching [3] with diffusion transformers [4] to process diverse multimodal conditions [5, 6]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:310c7590ecdcd1c2efa5c52560e2f161fb1701a3d08c9cdcd68e76e09f9d0d73","observation_id":"8b3441bd-555a-41f6-bdf8-c3ebecd3d777","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"cited_work":{"arxiv_id":"2606.10046","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10046","snapshot_observed_at":"2026-07-03T03:37:36.092730Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","venue":"cs.SD","work_id":"516e2b2a-1ce2-4145-be48-bd46a71e6c01","year":2026},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2606.10046","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:f81b4f97cdcedde231a7417bdf3ebc0a996a10977011a31e4fbeafb30f1fcf3a","observation_id":"45dad634-6577-4fbe-89a4-b3212a697f3d","resolution":{"observed_at":"2026-07-03T03:37:36.094295Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"This model features 12 transformer layers and utilizes a 16 step Euler solver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:ba8d45b2ed901771b862796650843b9778b6d5529208d83476f1c5803716649d","observation_id":"5cc7ab16-cf87-46fd-84ec-ae05af597acc","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Dual Pathway Conditioning We observe an asymmetric division of labor within the text con- ditioning mechanisms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:fe7a96bdc3eb30db2e6f7d3f945c6459a3e9db44b22564f7ae03a8c4a6892ae4","observation_id":"3fa27997-c982-4cdf-9205-ed13ac327859","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"We quantitatively establish a dual pathway text conditioning mechanism where additive injections govern se- mantic identity while cross attention resolves acoustic textures","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:09eebb80d2dad0552a9c9acf2548fbc6389d44ec7a76deda6cef70cce90fded4","observation_id":"32d42af0-ac2b-4d23-908e-651d0c280db7","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"The tool was not used to generate scien- tific content, experimental results, or conclusions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:b008d8f4b834bd85bb8d73332a9c3f86babcbc702b7e74ecd40e173f0493e139","observation_id":"7d26c95d-f52a-4861-a791-253f7abde777","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Segment anything,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:dc00fae36fb00012a7526619e193582504a76f16b85705271220bc26ea79b3c2","observation_id":"c1692c5b-67c6-4ad6-880b-5566865963f4","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":"2304.02643","doi":"10.1109/iccv51070.2023.00371","metadata_source":"pith","pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Segment Anything","venue":"cs.CV","work_id":"2bbf46ca-720a-45a1-8e9c-10c33fbeada0","year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:813a2a4fb2492f8ed036942e220a6e5d5528b10d5c1b17a1f1433e8e44375706","observation_id":"b8957983-644c-4f42-9e08-4d04c0d41db4","resolution":{"observed_at":"2026-07-03T03:37:36.075523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:49:01.392868Z","title":"Ruijie Tao, Zexu Pan, Rohan Kumar Das, Xinyuan Qian, Mike Zheng Shou, and Haizhou Li","venue":null,"work_id":"5bd56fef-407a-4446-be8f-25022aa39c63","year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:0f3b84a3cf97bffd19a8a7da68b852e8f59a678290db2b2eb4ce73445ad0af78","observation_id":"058b4040-f6d6-4f54-b4c5-d1da7a0d8f92","resolution":{"observed_at":"2026-07-03T03:37:36.028108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:24479fc99dc8a0c00ce548fbabc4689ef8d337b8b2ea600d2b9319108dbc23f3","observation_id":"76741ec2-5c90-4cb8-b007-e72231436cad","resolution":{"observed_at":"2026-07-03T03:37:36.049328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:b249c0c04a77f4ebe65da76ae30f7ad87fac10654a570edf897e905ea939d1d2","observation_id":"d92f528d-f6a7-44bc-bde4-8244e8baf938","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-07-06T18:49:06.836479Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":"2407.14358","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-07-08T00:04:22.330619Z","title":"D., Carr, C","venue":"cs.SD","work_id":"f51f1d58-4625-4dca-a20f-73a7705ac847","year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:50bbe451fcfd415f5ea612824b3b8ab580c2cc57fae5105a02e2993c1dbcb8ac","observation_id":"272e8f04-9d4f-45f9-92b8-6765519d2e9f","resolution":{"observed_at":"2026-07-03T03:37:36.044182Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-07-06T16:04:58.235073Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":"2308.05734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-07-03T03:37:36.063263Z","title":"AudioLDM 2: learning holis- tic audio generation with self-supervised pretraining","venue":null,"work_id":"9de10ce0-8dde-4ae3-8867-3b8f2026b90b","year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:7cbaa3f628b6109350844e15b1579ba54c579261ea496bf1571793a083355036","observation_id":"efa4768f-3971-4717-b90a-b10cfdcfce84","resolution":{"observed_at":"2026-07-03T03:37:36.064677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:ac2ed5f924419a30fd5a9906e27a5ff13a93efe6c8c2a3cda38d2acb8a5d6a59","observation_id":"285cf56d-b570-4f47-8b78-ab418ab5e431","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9660.2025","doi":"10.1109/icassp49660.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Masked image pretraining on language assisted representation","venue":null,"work_id":"c9f474fb-eb82-47dc-b6e2-4fca1225b9d3","year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:07263f8bfc3b4b9de91b73da2a71364fcb2b7cb151fdd0da1be1729a48ddd134","observation_id":"555d6230-e827-400c-9704-0aee63684e62","resolution":{"observed_at":"2026-07-03T03:37:36.096983Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"MGE-LDM: Joint latent diffusion for simultaneous music generation and source extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:a63f57b5630eaa79084e632898a1a0a9b83e66be9ffa8b8b9e4aa12613ccb738","observation_id":"f9bd56b9-448a-4e6c-af79-cd7a53beeddd","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"LiteFocus: Accelerated diffusion inference for long audio synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:9d8389373bd58e44ded2bce29b4d40bb50997ee06aea4c28c07a0456596264ee","observation_id":"dd9007da-f6b6-4352-887f-d226b666e787","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13094","last_updated":"2025-05-19T13:25:51Z","snapshot_observed_at":"2026-07-06T21:26:15.934710Z","submitted_at":"2025-05-19T13:25:51Z","title":"Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation","version":1},"cited_work":{"arxiv_id":"2505.13094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13094","snapshot_observed_at":"2026-07-03T03:37:36.071768Z","title":"Time-frequency- based attention cache memory model for real-time speech separation,","venue":null,"work_id":"8d909788-21b6-4960-be96-cfaf2da874a9","year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2505.13094","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:6a74402c0b8f8d158843bd2c908dea54a91f5481d0e048fb30ce24e61fb0ff3e","observation_id":"49e5eb20-ed5d-4c9b-8dc9-2bd05efb229d","resolution":{"observed_at":"2026-07-03T03:37:36.073117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Explicit-memory multiresolution adaptive framework for speech and music separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:d5e2fcff2c193ad8152941f314b9c200d9d00e5c5187feb1f705d243107c106c","observation_id":"0e4c9ee9-67ae-473a-91a0-f9f6002effc4","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"What the DAAM: Interpreting stable diffusion using cross attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:7900f352c1fc34e25a417fcfac91a823dfb8e6daa23bc09052d1365089237094","observation_id":"9c814976-345f-40bf-bd70-36bbe2c97c1d","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Masked-attention diffusion guidance for spatially con- trolling text-to-image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:9efbdf10bba6c37915dcc43cdcfa8240a2bbf2a452b07605d4dba212c2902f77","observation_id":"55eb1316-59fe-48dd-989c-3f3fa79de441","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13826","last_updated":"2023-05-31T15:42:00Z","snapshot_observed_at":"2026-07-06T14:46:41.380338Z","submitted_at":"2023-01-31T18:10:38Z","title":"Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":"2301.13826","doi":"10.48550/arxiv.2301.13826","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.13826","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models","venue":"arXiv (Cornell University)","work_id":"92bbf1bb-4319-45c4-845c-523bfc2cb97b","year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2301.13826","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:fe4eae6ce9a263ab45b9e8f60d4a3d6c107b284c6948e752698c644de7faa1a9","observation_id":"09318f53-fa1f-4340-8c8a-5f2fd43bd465","resolution":{"observed_at":"2026-07-03T03:37:36.038692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:55e308504554188d9d6a79d00d80b0bf61a0f11d9117d80a46293fc00b4c24e2","observation_id":"5cfc4df9-f2d9-4371-b4e9-83d0f966e667","resolution":{"observed_at":"2026-07-03T03:37:36.056602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":"2208.01626","doi":"10.48500/arxiv.2208.01626","metadata_source":"pith","pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","venue":"cs.CV","work_id":"196f7eef-d65a-47e4-b815-9a188f6aedcf","year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:0bdd06d453f43b5b6897ba711645af999e5440bd91bbffae9df2f7eb1793cb11","observation_id":"efcadebb-1767-4705-95b4-e49254c6a561","resolution":{"observed_at":"2026-07-03T03:37:36.046282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Complex image-generative diffusion transformer for audio denoising,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:f93ab597fcb4675dba3fe6e91b9d7ccc5bb6a6dc3b3a743ec4d9da9c43715bd0","observation_id":"b4aa1219-6395-4106-b8d7-59e6b1deafeb","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Causal deciphering and inpainting in spatio-temporal dynamics via diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:9920736e0fd90ca636b44bcf285087129dca76b1e10b37a89df49bdaccc467cd","observation_id":"1b836ba5-38d8-463b-8bf2-d8a12370b6bf","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Attention is not explanation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:95e1b77d87d47ccd03b9199301ed5f0290495b528959ffcc6311753446b4723c","observation_id":"7043eb93-cf34-41b6-99b9-794366d7c9b0","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03431","last_updated":"2024-03-06T03:32:56Z","snapshot_observed_at":"2026-08-03T13:50:02.414004Z","submitted_at":"2024-03-06T03:32:56Z","title":"Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing","version":1},"cited_work":{"arxiv_id":"2403.03431","doi":"10.48550/arxiv.2403.03431","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing","venue":"arXiv (Cornell University)","work_id":"69f5978d-64d8-4fbc-a692-03cee1d8cb3f","year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2403.03431","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:dfc2a7c5378d4b1ee2c04a898904b0ec620334eb3290ae55ca3ec01fe640f691","observation_id":"4a0f427d-a7ca-4586-95e1-a676ed515ab3","resolution":{"observed_at":"2026-07-03T03:37:36.052378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Transformer interpretability be- yond attention visualization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:876f01f771c2c41bd9fe2868ee499fa2eff8509246a1894eb8de9b494a392280","observation_id":"2de93308-1833-4823-99dd-dad29624b8f7","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Pearl,Causality: Models, Reasoning, and Inference, 2nd ed","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:4cec52286e850ece77b89feedff35584673913746822524002e55841b787f7f2","observation_id":"c3c7e156-25af-4e87-a1d4-3ce30adcc5ad","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:11ade002b90c8241ebba49f652419784728c04c831c7cdf655bdbda4580edee4","observation_id":"09355168-01fc-4f43-b1bc-d726ae7574a3","resolution":{"observed_at":"2026-07-03T03:37:36.051949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.07871","last_updated":"2017-12-18T21:25:53Z","snapshot_observed_at":"2026-07-06T06:00:57.001365Z","submitted_at":"2017-09-22T17:54:12Z","title":"FiLM: Visual Reasoning with a General Conditioning Layer","version":2},"cited_work":{"arxiv_id":"1709.07871","doi":"10.48550/arxiv.1709.07871","metadata_source":"pith","pith_arxiv_id":"1709.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FiLM: Visual Reasoning with a General Conditioning Layer","venue":"cs.CV","work_id":"ce5be7c6-3613-4a28-88d7-fc7aa82693b2","year":2017},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/1709.07871","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:23439390a4ab93f57ef7dfea1630cbaf50088c53a07aaa818c67fae9da97fc11","observation_id":"a14505cf-1075-4310-afea-bed20264f453","resolution":{"observed_at":"2026-07-03T03:37:36.057544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:23:12.977819+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:23:12.977819+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":"1706.03762","doi":"10.1186/s13550-021-00830-6","metadata_source":"pith","pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Is All You Need","venue":"cs.CL","work_id":"baafb5a2-5272-43bc-932f-09fa9ffe5316","year":2017},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:5faeb8c7f37a364cdadeabdb2deb0d46246d314c854f12a6f1ba66e4e8b40936","observation_id":"54e25014-83d4-4311-821c-ca6ca44e8596","resolution":{"observed_at":"2026-07-03T03:37:36.062870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:12581f35817a9b334d20cf2b214f186b88e22deee89ef5f2de2677f1803152a3","observation_id":"30234035-7ea8-4416-b233-a0fa3dbb3417","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06546","last_updated":"2023-10-26T22:17:49Z","snapshot_observed_at":"2026-07-06T15:41:13.274608Z","submitted_at":"2023-06-11T00:13:00Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","version":2},"cited_work":{"arxiv_id":"2306.06546","doi":"10.48550/arxiv.2306.06546","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.06546","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-fidelity audio compression with improved rvqgan","venue":"arXiv (Cornell University)","work_id":"377fbd72-7799-4b45-a519-e458481dbd13","year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2306.06546","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:a1111c0a124a6b1fc9961e99a9c0c0bac937b199c77f2ef764f789504ac69d39","observation_id":"672edff9-c431-48c5-a3ec-704f628101a4","resolution":{"observed_at":"2026-07-03T03:37:36.067248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:57de34598aabb634db31efcf1940b59998906a142529fe0a6b23eb52ede6fd16","observation_id":"bf3ed96b-e948-4324-84fb-5509ccfcd373","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"ESC-50: A dataset for environmental sound classifi- cation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:d6abfc8ab031cbd9647819f74cf9b3d8e2110bf02952ae0cd1a184747c28eb76","observation_id":"7d9b7cdc-293a-45a9-85a4-9894e3922af2","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-02T22:15:33.611696Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":"2010.00475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-07-03T03:37:36.034511Z","title":"Fsd50k: An open dataset of human-labeled sound events","venue":null,"work_id":"086c4edc-b322-4083-b264-2595ae1fb386","year":2010},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:424079f758707f81f3059dae8b0f6f2c6177ffddf982efba112d047b80a1db54","observation_id":"4ea5f234-c3e1-4b20-b44b-243c99124b5c","resolution":{"observed_at":"2026-07-03T03:37:36.035958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:7aca893495788a522c1b0e4882257b550b1cd88fb944bdfe62694f7605e08797","observation_id":"07224c14-c0ea-48d4-96ca-1b1708343237","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Performance measure- ment in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:f3359105852b658dc7117d7fc620533b155ebf84846ff13cc7543c38d0414ea5","observation_id":"667c3794-7945-4d37-96c0-8def94d1258a","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"An al- gorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:525304ea4b55f5941d967212193057d798a34c73685b81835fdb91fffa998fb8","observation_id":"0ddd32bb-8a2d-4210-b464-dd30cb8e6be0","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:6068a56b5275d36626550fd011943cda400a1aaa15065a600a5b88affd5f211c","observation_id":"4e1b7238-e05f-457f-9a16-c7d725999cac","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Cohen,Statistical Power Analysis for the Behavioral Sciences, 2nd ed","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:82d98f4ec2943bc7fcfe79c1b63a9ca10d22b2cdc77146c45c1774b8c9524863","observation_id":"19dba423-7f35-4535-bccd-97e1427d2ddf","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00858","last_updated":"2023-12-07T17:24:18Z","snapshot_observed_at":"2026-07-06T16:55:49.813116Z","submitted_at":"2023-12-01T17:01:06Z","title":"DeepCache: Accelerating Diffusion Models for Free","version":2},"cited_work":{"arxiv_id":"2312.00858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.00858","snapshot_observed_at":"2026-07-03T10:17:58.016027Z","title":"DeepCache: Accelerating Diffusion Models for Free","venue":null,"work_id":"5d2ad1a5-57a1-4d3b-85fe-dd0d1e400e86","year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2312.00858","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:78156935161393cc0e96983551f4443263cdd1dbe76b4d9c24777374a7f7a694","observation_id":"eb6e1102-2f61-44ba-bc19-b79f571d4d07","resolution":{"observed_at":"2026-07-03T03:37:36.065459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:3e2dc2e5e809a51ddaca03bb00a189cf6ad16e033342db6b2f0ce4902e604705","observation_id":"19af04b0-34df-461c-90a7-cee1437ecc38","resolution":{"observed_at":"2026-07-03T03:37:36.046603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:95f99b9aeada4f25c1353d42e85b89a9e826ed3d600b19ee1e4bea7ada3573a2","observation_id":"e14ab19a-00a3-4fda-a5fa-7181d5adcf06","resolution":{"observed_at":"2026-07-03T03:37:36.030477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-03T02:03:48.954468Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":"2206.00927","doi":"10.48550/arxiv.2206.00927","metadata_source":"pith","pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dpm-solver: A fast ode solver for diﬀusion probabilistic model sampling in around 10 step s","venue":"cs.LG","work_id":"5a71e28c-3c07-4f30-bfe2-17ea2361df24","year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:d35ff3a207631724761d971335c08492a1cacc82ac2093561d43ac99935847a3","observation_id":"8c51fa33-cb42-4d6c-88cf-df9e00be0798","resolution":{"observed_at":"2026-07-03T03:37:36.068170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:20ec83c4ba747205caac0730bffa07f0de83fb66d44a52934518acf6d402e04b","observation_id":"08eeebb6-5f54-4415-8a26-8a6715794c17","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:99d01bec696bb17d366d732a1b419989d877a4f59ea8fb2a4aefb9cdaa13ab3a","observation_id":"61bc9cf0-6fc2-45d7-bc72-15052157dd60","resolution":{"observed_at":"2026-07-03T03:37:36.041477Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-07-06T17:26:47.184846Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":"2402.04825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-07-03T03:37:36.031809Z","title":"arXiv preprint arXiv:2402.04825 , year=","venue":null,"work_id":"11e92f45-c916-45ac-ad78-45e1874ff993","year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:fe83d19c08c8fb6c468f872e005505944712b92d7763da29ffebee3da5af312a","observation_id":"a4a215e1-a2a8-4513-9676-b6135b66641a","resolution":{"observed_at":"2026-07-03T03:37:36.033208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"EzAudio: Enhancing text-to-audio generation with efficient diffusion transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:ca468b09ce44c338db36fd59c45ee2c8f3de06b715d85749002edba1c88f05e1","observation_id":"b0aae27a-b599-49b5-9419-a2425e8d75d6","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"W A-Transformer: Window attention-based transformer with two-stage strategy for multi-task audio source separation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:10e2af49224f655dec4713c2dfe61041b0fa67f2436675a82df2d0a22c017424","observation_id":"d8f2b273-8ca6-4382-95f9-a28296097411","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"TriBERT: Human- centric audio-visual representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:5143d879536e76820b589aebcfeaa44593f053a5120c07f8cc0b4f90f2dc3311","observation_id":"6f26ece9-47cc-4ad9-ad66-70b441e2c1d0","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"SepTr: Separable transformer for audio spectrogram processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:913ea4d0612b6e3d6269d2e97e1c7a0ad42fc5ce719b33435c7c44d6dd38351c","observation_id":"5eb6db82-ca77-4d4b-bacd-a9ecad2e079d","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/9746312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:37:36.058675Z","title":"HTS-AT: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":"8f856b64-2b76-4747-a88c-585ec7c8359d","year":2022},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:a658643bc790637e5dcb53f284c9d3f61f4bd3c838a46955062fc9a092a801f1","observation_id":"4b62f3db-f54d-4bbe-8a9f-0ee1a1c05916","resolution":{"observed_at":"2026-07-03T03:37:36.060198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Interpretability analysis in transformers based on attention visualization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:2b94a1f233006f6ec547a21632881b7a2121c25adcc9eebb581f490a448731e5","observation_id":"bc3dcc49-c740-44ed-b39e-b1f932e77f14","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Dynamic knowledge condensation with audio-selective transformer for audio deepfake detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:55c0813ef38dc7c4e4603636f4b9b721386c15b18c0539971f7b7def8ae80df5","observation_id":"99a9c83d-ccfa-454a-ae02-8d673ca448c2","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:58:27.176375Z","title":"Available: https://link.springer.com/article/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:7c813ea83e68f52a8ac24ac60acd823ec28119794189b5db45ecd6a937c562c6","observation_id":"2732c35b-371d-4f8b-b2c7-c7af90d09b14","resolution":{"observed_at":"2026-06-27T14:58:27.176375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08541","last_updated":"2023-05-15T11:12:20Z","snapshot_observed_at":"2026-07-06T15:27:13.785103Z","submitted_at":"2023-05-15T11:12:20Z","title":"Ripple sparse self-attention for monaural speech enhancement","version":1},"cited_work":{"arxiv_id":"2305.08541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08541","snapshot_observed_at":"2026-07-03T03:37:36.023923Z","title":"Ripple sparse self-attention for monaural speech enhancement,","venue":null,"work_id":"0f66228a-2556-492f-a26f-c6c2176813b4","year":2023},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"cited_paper":"/paper/2305.08541","citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:cb1534d63deae41c834ae1350727c3c7a70523aad22b432b38af3ca84828f6ad","observation_id":"5a668968-1c7d-4a28-a455-9a106a8b9fbc","resolution":{"observed_at":"2026-07-03T03:37:36.025324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1092451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:37:36.069254Z","title":"Disentangled-transformer: An explainable end-to-end automatic speech recognition model with speech content-context separation,","venue":null,"work_id":"70ec0511-4094-41f4-ba5b-80c0fe9fe14b","year":2025},"citing_paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T14:58:27.176375Z"},"links":{"citing_paper":"/paper/2606.10046"},"observation_digest":"sha256:f37371cd39126e240a26850d9a0dcdd50a2d161f9f672afea38f17a1d79e9d56","observation_id":"b462b16a-be9b-494a-91db-c5be7f751735","resolution":{"observed_at":"2026-07-03T03:37:36.070644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.10046","last_updated":"2026-06-10T16:28:45Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T07:13:46.298081Z","submitted_at":"2026-06-08T18:18:28Z","title":"Inside the Latent Flow: Causal Deciphering of Attention Dynamics in Audio Separation Foundation Models"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":3,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":32,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2606.10046."}