导读:AI大模型日报,爬虫+LLM自动生成,一文览尽每日AI大模型要点资讯!
目前采用“文心一言”(ERNIE 4.0)、“零一万物”(Yi-Large)生成了今日要点以及每条资讯的摘要。欢迎阅读!
《AI大模型日报》今日要点:智谱AI近日发布了新一代开源语言模型GLM-4-9B,以其强大的推理性能、多模态处理能力及对多种语言的支持受到关注。该模型使用FP8技术提升训练效率,并在中文对齐、指令遵从等方面有显著进步。与此同时,Stability AI推出名为Stable Audio Open的音频生成模型,能生成长达47秒的高质量音频,为音乐制作和声音设计领域带来新工具,尽管其在逼真声音生成等方面仍存局限。 在AI创业方面,李沐携其大模型成果Higgs-Llama-3-70B回归B站,该模型专为复杂场景角色扮演设计,在多项基准测试中表现突出。此外,斯坦福华人博士创立的Pika宣布再融5.8亿,其自研的AI视频生成模型受到市场青睐,体现了AI视频生成赛道的投资与技术热度。 在学术研究领域,牛津大学与谷歌研究院联合开发的“CLIP as RNN”技术入选CVPR,该技术无需训练即可分割图像中的无数概念,为图像分割带来革命性进展。另一方面,马毅教授团队的CRATE-α模型通过数学推导设计每一层,提升了Transformer架构的可解释性和性能,展示了其可扩展性。 在AI应用层面,Paige开放全球最大病理学和肿瘤学AI模型使用权,阿里巴巴与世卫组织合作推广AI癌症筛查,腾讯则利用AI技术破解甲骨文之谜,推出了相关的平台和小程序,彰显了AI在多个领域的广泛应用潜力。
标题: GLM-4-9B 开源,探索模型极限
摘要: 智谱AI发布了新一代开源语言模型GLM-4-9B,该模型在预训练中使用了FP8技术,训练效率提升3.5倍,数据量是前代模型的3倍以上。GLM-4-9B具备更强的推理性能、更长的上下文处理能力、多语言、多模态和All Tools等功能。模型包括基础版本、对话版本、超长上下文版本和多模态版本。GLM-4-9B在中文对齐能力、指令遵从、工程代码等方面有显著提升,支持26种语言,并能处理长达1M tokens的文本。此外,模型还具备强大的函数调用和多模态处理能力,可智能调用外部工具和处理图像输入。
网址: GLM-4-9B 开源,探索模型极限|调用|模态|glm|预训练|上下文_网易订阅
标题: Stability AI开源47秒音频生成模型,虫鸣鸟叫、摇滚、鼓点都能生成
摘要: 科技记者报道: Stability AI 推出名为 Stable Audio Open 的开放模型,该模型可生成高质量音频数据。与商业版 Stable Audio 不同,Stable Audio Open 能通过文本提示生成长达47秒的音频。它擅长制作鼓点、乐器片段、环境音等,适合音乐制作和声音设计。用户可根据自定义音频数据对模型进行微调。该模型基于Transformer架构,由自编码器、文本嵌入和扩散模型组成。训练数据来自FreeSound和Free Music Archive,确保无版权问题。尽管Stable Audio Open 1.0在音频生成方面表现出色,但存在局限性,如无法生成逼真声音、对非英语描述支持有限、音乐风格多样性不足等。此外,该模型并非开源,且不能用于商业用途。
网址: Stability AI开源47秒音频生成模型,虫鸣鸟叫、摇滚、鼓点都能生成 | 机器之心
标题: 李沐老师回归B站!带着大模型创业成果填坑来了
摘要: 科技记者简讯: 李沐,AI领域知名学者,宣布回归B站并带来其大模型创业成果——Higgs-Llama-3-70B。该模型专为复杂场景角色扮演设计,基于Llama 3打造,并进行了完整的SFT、RLHF训练。在角色扮演任务和通用领域指令遵循、推理方面表现出色。Higgs-Llama-3-70B在MMLU-Pro和Arena-hard基准测试中展现了优于其他模型的能力,包括Claude3和Gemini。尽管与GPT-4o仍有差距,但团队强调并未针对性刷榜,并计划发布更多Higgs系列模型。李沐的创业公司Boson AI致力于利用AI技术为企业赋能,开发Agent以扮演多种角色,如游戏角色、语言教师等。团队成员包括李沐、Alex Smola等资深AI专家。公司已获得知名技术创业者投资,未来将进一步探索角色扮演性能、训练后的处理流程等策略。
网址: 李沐老师回归B站!带着大模型创业成果填坑来了 | 量子位
标题: 郭文景Pika再融5.8亿,最新估值约34亿,已自研AI视频生成基础模型
摘要: 科技记者报道: Pika,一家由斯坦福华人博士创立的AI视频生成初创公司,近日宣布完成新一轮8000万美元融资,估值达到4.7亿美元。投资者包括Spark Capital(领投)、Lightspeed和Greycrof等知名机构。Pika自研AI视频生成基础模型,产品1.0去年底发布,半年内团队从4人扩张至13人,并上线了多项新功能。AI视频生成赛道今年迎来技术与投资的双重爆发,Pika等初创公司正快速扩张,利用OpenAI和谷歌视频工具尚未公开的机会窗口。
网址: 郭文景Pika再融5.8亿,最新估值约34亿,已自研AI视频生成基础模型 | 量子位
标题: CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院
摘要: 科技记者报道: 在图像分割领域,牛津大学和谷歌研究院的联合团队开发了一种名为“CLIP as RNN”(CaR)的新技术,该技术允许无需额外训练即可有效分割图像中的无数概念。这项成果已被CVPR 2024接收,并开源了代码。CaR技术解决了开放词汇量图像分割的几个关键问题,包括无需训练数据、保留预训练视觉-语言模型的广泛词汇空间以及对非图像中概念的文本查询处理。该技术通过迭代过程逐步优化,提高了分割质量,并通过循环调用CLIP模型,实现了高质量的开放词汇分割。
网址: CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院 | 量子位
标题: 首次证实白盒Transformer可扩展性!马毅教授CRATE-α:鲸吞14亿数据,性能稳步提升
摘要: Transformer架构在AI领域取得了显著成就,但其设计缺乏严格的数学解释。马毅教授团队发布的CRATE模型通过数学推导设计每一层,提供可解释性。最近,加州大学研究团队提出CRATE-α,探索不同规模CRATE在视觉任务中的性能,并通过策略性修改提高可扩展性。CRATE-α在ImageNet分类任务上表现优于传统CRATE,且可解释性得到提升。研究还展示了CRATE-α的可扩展性,以及在资源有限情况下通过精心设计的预训练和微调策略扩展模型的有效性。项目链接:https://rayjryang.github.io/CRATE-alpha/。论文链接:https://arxiv.org/pdf/2405.20299。
网址: 首次证实白盒Transformer可扩展性!马毅教授CRATE-α:鲸吞14亿数据,性能稳步提升|马毅|研究人员_新浪新闻
标题: 全球最大病理学和肿瘤学多模态模型开放使用权;阿里达摩院与世卫组织推广AI癌症筛查;腾讯发布甲骨文AI协同平台:可映射到现代汉字
摘要: AI for Science企业动态速览: - Paige推出针对药物开发的AI服务,提供全球最大病理学和肿瘤学AI模型使用权。 - 阿里巴巴与世卫组织合作,推广达摩院AI癌症筛查技术。 - 谷歌与日本签署太阳能供电协议,为数据中心供电。 - Atropos Health完成3300万美元融资,进军药物研发。 - 中国气象局发布AI气象预报大模型示范计划。 - 腾讯用AI破解甲骨文之谜,推出“殷契文渊”平台和“了不起的甲骨文”小程序。
网址: 全球最大病理学和肿瘤学多模态模型开放使用权;阿里达摩院与世卫组织推广AI癌症筛查;腾讯发布甲骨文AI协同平台:可映射到现代汉字 - 智源社区