V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  conhost  ›  全部回复第 2 页 / 共 4 页
回复总数  66
1  2  3  4  
@hguangzhen 1 就不说了。机器学习的训练一般是端到端的,基本上是不能分解的,只能并行训练。然而不像挖矿一样单机是对同一个输入计算,模型并行各机器上需要针对不同的数据进行训练,并将训练中的梯度汇总到中心服务器,这就限制了各个框架的随意进入和退出,同时还需要各种措施保证梯度的准确性。
此外,这并不能解决算力的问题啊,该需要多少算力还是多少算力,只是解决有没有可用算力的问题,限制参与资格的还是钱呀。
1 、不是能用虚拟币买的东西,都能用 RMB 买么?而且如果真用虚拟币购买,怎么开发票?
2 、是大模型需要的算力很庞大,也就是说需要的钱多,这才是限制参与资格的地方。
2023 年 3 月 31 日
回复了 ZakaryTime 创建的主题 程序员 求助,在 Memos 中使用本地自建 minio 作为后台存储
minio 的服务端口和 web 端口不是同一个,所以是你的端口不正确
2023 年 3 月 10 日
回复了 wafffle 创建的主题 Surge 求教 surge 增强模式的原理
如果你们公司的 VPN 也是添加了一个虚拟网卡的话,你可以在配置文件中添加公司子网直连代理,出口为公司 VPN 的网卡。
具体可以参考: https://manual.nssurge.com/policy/parameters.html
2023 年 2 月 16 日
回复了 fengleiyidao 创建的主题 问与答 wls2 跑机器学习,有一战之力了么?
2023 年了,该用集群了,模型单机跑不动了
2023 年 1 月 31 日
回复了 alexcding 创建的主题 Apple 订阅通 2.0 发布 - iOS/Mac 订阅管理软件[送码]
没抢到,楼主私信一个,感激不尽
2022 年 12 月 28 日
回复了 8675bc86 创建的主题 Apple Ventura 的 Mail 用不了
你的设置问题,黑果白果 Ventura 都在用,没有什么问题。
2022 年 12 月 13 日
回复了 fzdoudou 创建的主题 问与答 AirPods Pro 掉马桶里了,捡还是不捡
捡呀,反正都是自己的
2022 年 12 月 4 日
回复了 qdwang 创建的主题 OpenAI ChatGPT 还不是最可怕的
问题在于,他知道的东西可能给你的答案是准确的。他不知道的给你的答案也是让人看起来没有啥问题。关键问题还在于你都不知道他说的是对的还是错的。

所以,目前来看 ChatGPT 还是玩具,偶尔调笑一下没啥问题,要是用在生产环境,那就不知道可能会带来什么问题了。
2022 年 12 月 2 日
回复了 numberator 创建的主题 问与答 有人用艾玛拉语写过翻译软件吗?啥事三值逻辑?
“听说曾经有老外人用艾玛拉语作为中介语言来翻译他任意两种语言,换句话的先把 A 语言翻译成艾玛拉语,然後再翻译成 B 语言,而且这种算法的准确度是最高的。”

这句话需要给出具体文献。据我所知,这应该是没有具体文献支撑的。

你说的这种翻译方法是基于枢轴的零资源或低资源翻译。目前主要使用的中间语言是英语,主要原因就是相对于其他语种,到英语的翻译语料是最丰富的。

具体到现在的神经机器翻译,基于枢轴的多语言翻译最有名的应该是谷歌的 2017 年的论文《 Google’s Multilingual Neural Machine Translation System: Enabling Zero-Shot Translation 》也是主要使用英语作为其中间语言的。目前并没有任何文献支撑使用艾玛拉语能达到最好的效果。

具体原因是:

最初的机器翻译是采用规则的翻译方法,这种方法需要人为的设计翻译规则,这种方法需要专家对两种语言的语法都非常熟悉,这个语言作为玻利维亚的官方语言,中央艾玛拉语使用者只有 2,227,642 人。而且机器翻译作为冷战的产物,最初的主要研究是针对俄语和英语的翻译的,应该不会专门针对这个语言研究。

而先前的统计机器翻译到现在的神经机器翻译作为基于数据驱动的翻译方法,都需要基于大量的语料对模型进行训练。基于其使用者人数,其应该是低资源的研究对象,而不是研究工具。
2022 年 11 月 4 日
回复了 ljinkai 创建的主题 推广 变现周刊#78:建立一个佣金网站,每月赚 4 万美元
你赚到 4 万美元了么?
2022 年 9 月 26 日
回复了 Taomanman 创建的主题 Surge 寻求有偿代写 surge 规则
楼上这些说这个说那个的,就是没有一个人说怎么写。
最简单的就是在 Proxy Group 定义 policy-path ,几个机场就你定义几个,然后在 Proxy 里面还可以加你自己搭建的节点,这样就可以只更新节点,不动其他配置
policy1 = select, policy-path=url, update-interval=0, tolerance=10
auto = url-test, policy1
2022 年 9 月 14 日
回复了 kerrspace 创建的主题 程序员 深度学习显卡选择(RTX A6000 和 RTX 3090)
@kerrspace 这个看你的需求了。如果要搞目前的大模型的话,当然首推更大内存的。但是虽然 3090 的计算速度不如 a6000 ,但是 a6000 也到不了 3090 的两倍,如果 24G 内存够的话,想要更快的话,还是推荐 3090 。此外,两张卡的话,你还可以一张用来调试,一张用来实验。colab 的话,就不用考虑了,pro 都只能分到 p100 ,pro+也只能分配到原来免费的 v100 。
2022 年 8 月 5 日
回复了 zxCoder 创建的主题 分享发现 感觉科研水论文就像鬼畜视频创作一样
恭喜你发现了科研界的流量密码
春困秋乏夏打盹,睡不醒的冬三月
@Richard14 改变的-1 维度是因为 lstm 是针对词进行处理的。至于三维向量的理解,你可以理解为第一位是是有多少条句子,然后每一条句子中有 20 个词,每个词的维度是 8 。
@conhost 如果你不理解长度的话,你可以使用 nn.LSTMCell(8,64),然后自己定义循环生成,结果也是一样的。
@Richard14 我不太理解的是你为什么会将 2 ,3 两个维度互换呢,20 是序列长度,也就是说一个序列单元要走 20 步到达结尾,如果你设置的 bacth_first=False 的话,你需要将 1 ,2 两个维度互换。总得来说,LSTM 是对每一个词进行处理。nn.LSTM(20,64)的意思是输入到 LSTM 的维度是 20 ,LSTM 的输出维度为 64 ,这里你设置应该是不对的。要么你把[32, 20, 8]经过一个线形变换,转换成[32, 20, 20],要么你设置 nn.LSTM(8 ,64)。
1  2  3  4  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   4037 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 32ms · UTC 04:16 · PVG 12:16 · LAX 21:16 · JFK 00:16
♥ Do have faith in what you're doing.