전체 글 (79) 썸네일형 리스트형 [Paper Review] Genomics of Drug Sensitivity in Cancer (GDSC): aresource for therapeutic biomarker discoveryin cancer cells 1. Introduction- 실제로 암세포 안의 유전자 변화가 서로 다를 수 있다.- 그래서 어떤 환자에게는 어떤 항암제가 매우 잘 맞지만, 다른 환자에게는 효과가 없을 수 있다.- 즉, 유전자 변화가 치료 효과를 예측하는 바이오마커 역할을 할 수 있다는 것이다. - 하지만 모든 항암제가 명확한 바이오마커를 가지지 않는다.- 게다가 같은 바이오마커지만 환자들 사이에서도 차이가 나는 경우도 있다.- 그렇기 때문에, 더 좋은 바이어마커를 찾는 것은 중요하다. - 여기서 중요한 것이 암 유전체 연구이다.- 최근 DNA 시퀀싱 기술이 발전하면서 암 안에 어떤 유전자 변화가 있는지 자세히 알 수 있다.- 이런 정보로 어떤 약이 어떤 암에 잘 드는지 찾는 것이다. - 환자에게 바로 실험할 수 없으니 암세포주를 사.. [Paper Review] The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity - 본 논문에서는 암세포의 유전정보를 보면, 어떤 약이 잘 들을지에 대해 예측할 수 있는지 연구한다.- 암은 종류도 많고, 같은 암이라도 사람들의 유전자 상태가 다르기 때문에 잘 듣는 약이 다를 수 있다. - 연구자들은 실제 환자의 암세포를 실험하기 어렵기 때문에, 이 논문에서는 CCLE(Cancer Cell Line Encyclopedia)을 사용한다.- 쉽게 말하자면 많은 인간 암세포주의 유전 정보와 약 반응 정보를 모아놓은 대형 데이터베이스이다.- CCLE는 다루기도 쉽고, 여러 실험을 반복하기 편리하다.- 실험실 암세포가 실제 환자의 암과 비슷해야 하기 때문에 CCLE 암세포주와 실제 환자의 원발 종양 데이터를 비교했다. - 예전에도 암세포주를 이용한 연구를 많았지만,- 유전 정보를 충분히 분석하.. [핸즈온 LLM] 1. 언어 모델 이해하기 (3) 3. 대규모 언어 모델 자세히 살펴보기import torchfrom transformers import AutoModelForCasualLM, AutoTokenizer, pipelinetokenizer = AutoTokenizer.from_pretrained("microsoft/Phi-3-mini-4k-instruct")model = AutoModelForCasualLM.from_pretrained( "microsoft/Phi-3-mini-4k-instruct", device_map='cuda', torch_dtype='auto', trust_remote_code=True)generator = pipeline( 'text-generation', model=model, .. [핸즈온 LLM] 1. 언어 모델 이해하기 (2) 2. 토큰과 임베딩[1] LLM 토큰화1. 토크나이저가 언어 모델의 입력을 준비하는 방법- 생성형 LLM은 입력 프롬프트로 응답을 생성한다.- 이 때, 프롬프트가 모델에 들어가기 전에 토크나이저에 통과시켜 토큰화를 진행한다. prompt = "Write an email apologizing to Sarah for the tragic gardening mishap. Explain how it happened."# 입력 프롬프트를 토큰으로 나눕니다.input_ids = tokenizer(prompt, return_tensors="pt").input_ids.to("cuda")# 텍스트를 생성합니다.generation_output = model.generate(input_ids=input_ids, max_ne.. [핸즈온 LLM] 1. 언어 모델 이해하기 (1) 1. 대규모 언어 모델 소개[1] 언어 AI란?- 언어 AI란 인간 언어를 이해, 처리, 생성할 수 있는 기술을 개발하는 AI의 하위 분야이다.- 종종, 자연어 처리(NLP, Natural Language Processing)와 혼용된다. [2] 언어 AI의 최근 역사- 우리가 쓰는 언어는 비구조적이기 때문에 컴퓨터가 이해하기 어렵다.- 그래서 컴퓨터가 이해할 수 있도록 언어를 구조적인 방식으로 표현하는데 집중해왔다. (1) BoW- BoW(Bag-of-Words)는 비구조적인 텍스트를 표현하는 방법이다. - BoW의 첫 단계는 문장을 공백을 기준으로 개별 언어로 토큰화(tokenization)를 진행한다.- 공백이 없는 중국어 같은 언어는 표현하기 어렵다. - 토큰화를 진행 후, 문장에 고유한 단어들을.. [집합론] 0. 공리적 집합론 1. 무한집합- 데데킨트는 무한집합을 다음과 같이 정의한다.: 자기 자신의 진부분집합과 1-1 대응이 가능한 집합- 진부분집합이란 자기 자신을 제외한 집합을 말한다. - 칸토어는 무한집합에도 여러 단계의 크기가 존재한다고 정의한다.: 어느 무한집합의 멱집합의 크기는 원래 무한집합의 크기보다 크다. 2. 연속체 가설- 자연수 개수의 집합을 ℵ0 이라고 하고, (0,1) 실수 개수 집합을 σ 이라고 하자.- 두 집합의 크기를 비교해보면 ℵ0 σ이다.- 그렇다면 ℵ0 σ 이러한 식을 만족하는 집합이 있을까?- 칸토어에 따르면 위를 만족하는 집합은 존재하지 않는다 말한다.- 이것이 연속체 가설이다.- 이 가설로 인해 명제는 '참', '거짓'으로 결정할 수 없는 명제도 존재한다는 것을 알려준다. 3. 러셀의 .. Movie Recommendation with Poster Attention - 논문에서 사용하는 데이터는 총 세가지 데이터로 이루어진다. 1. 텍스트 정보 -> 영화 제목, 소개글 2. 이미지 정보 -> 영화 포스터 3. 구조화된 데이터 -> 장르, 직업 (태블로 데이터?) [1] Textual feature extractor- BERT 모델로 텍스트 데이터 특징을 추출한다. - Wx는 입력 텍스트 시퀀스에 포함된 하나의 단어이다.- 텍스트 시퀀스 앞뒤에 각각 [CLS], [SEP] 토큰을 추가한다.- 위 시퀀스를 인코딩해 밑에 hidden state를 얻는다. - BERT 모델에서 첫 번째 토큰인 [CLS]는 multi-head self-attention으로 모든 토큰들과의 attention을 계산한다.- BERT 모델은 Masked Language Model(MLM), .. [Paper Review] GAMENet: Graph Augmented MEmory Networks for Recommending MedicationCombination 1. Introduction- 약물 추천을 위해 딥러닝 방법들이 많이 설계되었다. - 한 가지 유형은 현재 내원에 대한 정보만 활용하는 사례 기반 약물 추천 모델이 있다.- 이 방법은 추천의 정확성과 유용성에 영향을 미친다. - 또 한 가지는 시간적 의존성을 활용하여 약물을 예측한다.- 이 방법은 모델링에서 약물 안정성, 특히 약물-약물 상호작용 (DDI) 을 고려하지 않는다.- 하지만 DDI는 복잡한 건강 상태를 가진 환자들 사이에서 흔하다. - 따라서 본 논문에서는 EHR 데이터와 DDI에 대한 약물 지식베이스를 입력으로 받아 약물 조합 추천을 생성하는 엔드투엔드 딥러닝 모델인 GAMENet을 제안한다.- GAMENet은 이중 순환신경망을 기반으로 한 환자 쿼리와 그래프 증강 메모리 모듈로 이루어진다.. 이전 1 2 3 4 ··· 10 다음