人工智能 | AUI 技术与产业观察

人工智能


2025

Aug 8

十分之一标签,凭什么打败全场

在精准肿瘤学里,一个被默认的常识是:喂给模型的标注样本越多,癌症亚型分型就越准。但2025年8月挂上arXiv的GTMancer框架,用一份不到1500字的实验设置,把这条铁律劈成了两半——全量7个公开癌症数据集上,仅用10%的有标签样本进行半监督训练,模型最终在测试集上的F1与准确率全部碾压SOTA。更离谱的是,当标签比例压到1%时,UCEC数据集上的亚型分类表现依然稳居榜首。是的你没看错,数据少了九成,结果反而更准。 主流叙事的第一道裂缝 过去十年,癌症多组学融合的叙事始终被一个隐含假设主导:基因组、转录组、表观遗传、蛋白质组……不同组学像各自为政的诸侯,必须用更复杂的图神经网络、更多层的注意力、更高阶的对比损失,才能勉强把它们"缝合"到一个统一表征里。结果是模型参数爆炸、训练成本飙升、对标注数据的依赖也水涨船高。一篇典型的多组学GNN论文,动辄要30%到50%有标 …
阅读更多
Mar 18

数字人突破:情绪控制告别“恐怖谷”

当你看到一段AI生成的虚拟人视频时,第一眼就能感觉"哪里不对"——这种微妙的不适感,业界称之为"恐怖谷"效应。问题的根源不是视觉渲染不够真实,而是AI系统对"情绪"的理解和控制能力,几乎为零。 一篇最新论文(2503.14295)带来了一项名为PC-Talk的突破性框架,首次在音频驱动的人脸生成中实现了精确的情绪控制和唇音同步分离。这项研究不仅在学术数据集上刷新了SOTA,更揭示了数字人技术走向真实应用的关键路径。 “恐怖谷"的真正根源:为什么现有方法总是不够"自然”? 在深入技术细节之前,我们先理解一下为什么现有的Talking Face生成技术总是差那么一口气。 当前的主流方案,如Wav2Lip、SadTalker、EMO,已经能够实现相当不错的唇音同步。但它们的共同弱点是:生成结果 …
阅读更多
Mar 7

金融RAG的时间盲区:AI为何分不清财报年份?

想象一下,你问AI助手:“苹果公司2022年12月30日的市盈率是多少?“它却给你列出了2024年的所有财务数据,然后一本正经地回答了你的问题。这不是科幻,这是当前金融多模态RAG系统的真实水平。 当RAG(检索增强生成)技术在金融领域被吹捧为"颠覆传统投研"的神器时,一篇最新论文(2503.05185)用实证数据狠狠地揭开了这个领域最尴尬的秘密:现有的金融RAG系统,连"时间"这个最基本的金融分析维度都处理不好,更别说多模态融合了。 FinTMMBench:一个让所有RAG系统"见光死"的基准测试 这篇论文的核心贡献是构建了FinTMMBench——第一个专门评估时间感知多模态金融RAG系统的基准测试。这个benchmark的构建过程本身就充满挑战: 研究团队收集了2022年所有NASDAQ-100公司的 …
阅读更多
Feb 10

AI背后的血肉工厂:拉美数据工人之殇

当科技大佬们在硅谷的发布会上侃侃而谈"AI革命"时,他们永远不会告诉你:那些让AI变"聪明"的数据,是阿根廷、巴西、委内瑞拉的高学历年轻人在昏暗的房间里一个标签一个标签敲出来的——每标注一张图片,赚不到一美分。 一项最新研究(2502.06317)用实证数据撕开了AI产业最不为人知的秘密:所谓"人工智能"的背后,是一张盘踞全球、跨越国界的数字劳动供应链——而拉丁美洲是这条供应链上最廉价、却最关键的劳动力来源地之一。 被"隐形化"的300万人:数据工作者的真实处境 研究选取了阿根廷、巴西、委内瑞拉三个拉丁美洲大国,对数据工作者进行了大规模混合方法调研。问卷调查与深度访谈交织,勾勒出了一幅令人窒息的画面: 这些人不是文盲,不是难民,不是被社会抛弃的边缘人。 他们中的大多数拥有大学学历,精通英语,熟悉电脑操作。他们本 …
阅读更多
Jan 29

深度生成模型:重写精准医疗规则

当科学家们还在用传统统计学方法勉强拼凑基因组、转录组、蛋白质组的数据碎片时,深度生成模型已经悄悄撕开了这个领域最丑陋的伤疤。 你有没有想过,为什么同样的癌症,有的患者存活率极高,有的却迅速恶化?答案可能藏在那些被传统方法严重低估的多组学数据里——基因组、表观基因组、转录组、蛋白质组、代谢组……每一个都是生命密码的一个维度,而医学界长期以来只能用盲人摸象的方式解读它们。 最近一篇发表在arXiv上的技术综述(2501.17729)揭开了一个令学界不安的事实:多组学数据整合的革命,不是即将到来,而是正在发生——而大多数研究者还没准备好。 被"维度诅咒"封印了几十年的生命科学 多组学研究的潜力是惊人的。TCGA、ICGC、ProCan等 consortiums 已经积累了海量数据,理论上足以揭示癌症的分子机制、发现新药靶点、识别生物标志物。但现实是,这些数据在绝大多数机构里处 …
阅读更多

2024

Dec 30

没点击的广告,反而最值钱

在腾讯广告系统里,一个预测框架上线后,ARPU(每用户平均收入)拉出 4.5% 的涨幅。撬动这个数字的核心变量,既不是更精准的点击率预估,也不是更复杂的用户画像,而是"用户没点击的那条记录"。这条看起来反直觉的路径,正在改写广告系统的预测范式。 主流预测模型,把最贵的数据扔进了垃圾堆 过去几年,广告系统的预测战场几乎被"点击率"三个字独占。工程师们比谁的 DNN 更深、谁的特征交叉更花哨、比谁能从用户历史点击里榨出多零点几个百分点的 AUC。但这场军备竞赛从一开始就埋着盲区:用户看见了广告、考虑了三秒、最终没点,这条数据在绝大多数系统里连日志的正式席位都没有。 这恰恰是工业界最荒诞的错配。真正决定一个广告系列能否跑出预算的,从来不是单次点击的概率,而是用户在持续曝光下的疲劳曲线。一条广告在用户面前出现第 1 次时点击率可能有 8%,第 3 次降到 …
阅读更多
Dec 29

跑分第一的AI,读不懂一句绝望

2024 年初发表的一篇论文测试了 11 个主流大模型在心理诊疗摘要任务上的表现。跑分冠军 MentalLlama 在自动评测中遥遥领先,但人类专家的盲审结论却是:这些模型在临床敏感维度上集体失灵,尤其对自杀风险和疗效评估几乎无能为力。 ROUGE-1 拿到 30.86 ,是胜利还是笑话 在 MentalCLOUDS 数据集( 191 场心理咨询对话)的竞技场上, MentalLlama 以 ROUGE-1 F1 值 30.86 的成绩登顶。这个数字乍看很美——比第二名高出几个点,在"症状与病史"摘要子任务上一骑绝尘。但任何盯着这一行数字超过十秒的人都会发现一个尴尬的事实: ROUGE-2 只有 5.46 , ROUGE-L 仅 19.4 。这不是"碾压式胜利",而是一场集体低分竞赛中的相对领跑,所谓"领先",不过是矮子里拔将军罢 …
阅读更多
Dec 6

你买的投资软件,两年后就是废铁

顶级私募正在悄悄换血。他们抛弃的不只是某家 SaaS 厂商,而是一整套依赖外部工具的决策范式。arXiv 上一篇被广泛引用的研究把这件事讲得很透:投资行业正站在平台颠覆的"起飞段",而绝大多数基金还没意识到,自己花大价钱买来的那套软件,正在变成阻碍竞争力的最大负资产。 第三方软件的四个死穴 买了十年彭博终端、堆着最贵 CRM 的基金,正在集体踩进同一个坑。 个性化缺位。第三方软件本质是"通用工具"。它不知道你这只基金专投 SaaS 早期轮、另一只死磕东南亚消费,所以它给出的 deal sourcing 清单永远是大路货。论文讲得直接:通用工具无法访问基金专属的投资论点,自然给不出真正差异化的推荐。 数据隐私悖论。把基金内部的组合数据、被投公司财务、上会纪要喂给第三方平台,等于把最核心的商业机密拱手让人。一家头部 PE 敢不敢把自己 LP 名单、估值模 …
阅读更多

© 2026 Hot Ingest